分布式Worker负载未在Master UI中正确显示的排查求助
分布式压测指标显示异常排查建议
检查Master与Worker的通信链路:
- 查看Master日志,确认所有Worker都成功完成注册,有没有节点断连、注册失败的记录,比如搜
worker connected或disconnected这类关键词。 - 核对防火墙/安全组规则,确保Master和Worker之间的通信端口(不同压测工具默认端口不同,比如常见的5555、5556)双向开放,没有被拦截。
- 查看Master日志,确认所有Worker都成功完成注册,有没有节点断连、注册失败的记录,比如搜
验证压测工具配置:
- 确认Master已开启全局聚合模式,部分工具默认仅展示本地节点数据,需手动开启分布式数据聚合开关。
- 检查Worker启动命令,确认正确指定了Master的IP和端口,没有参数错误导致Worker无法上报数据。
排查UI数据采集逻辑:
- 确认UI的数据源是从Master的全局聚合接口拉取数据,而非单个Worker的节点接口。
- 直接调用Master的聚合数据API(比如
/stats/aggregated,具体参考工具文档),如果API返回的是所有Worker的总和数据,那问题出在UI前端的渲染或数据处理环节,可能是缓存未更新或逻辑错误。
检查资源限制:
- 查看Master服务器的CPU、内存、带宽占用情况,当大量Worker上报数据时,Master资源不足会导致丢包或无法及时处理数据,进而使UI显示不全。
- 查看Worker节点日志,有没有
failed to send metrics to master这类上报失败的报错,可能是Worker自身资源不足导致无法正常上报。
核对工具版本兼容性:
- 确保所有Worker和Master使用同一版本的压测工具,不同版本的通信协议可能不兼容,导致Master无法正确聚合数据。
- 如果使用旧版本,尝试升级到最新稳定版,不少分布式指标聚合的bug在新版本中已修复。
内容的提问来源于stack exchange,提问作者Jacob Steinberger
相关产品推荐
相关产品推荐

