Google Metrics Explorer监控API请求延迟与端点控制台数值差异咨询
问题解答
1. 指标数值差异的核心原因
- 统计量口径完全不一致:Endpoints控制台你选择的是*中位数(50分位)延迟,仅代表样本中排名中间的请求延迟,不受少量高延迟长尾请求影响;而Metrics Explorer你选择的是均值(mean)*统计,会把所有请求的延迟求和后平均,只要存在少量高延迟请求,数值就会被大幅拉高。
- 维度聚合规则不同:Endpoints的「latency by response code (median)」默认按响应码拆分统计,你查看的是某一类响应码的中位数;而Metrics Explorer未设置分组,是所有响应码(含高延迟的4xx、5xx错误请求)混合后的均值,进一步放大了数值差异。
- 对齐周期差异:Endpoints控制台默认使用更细的对齐窗口(通常为10秒),1分钟的对齐周期会把更多样本聚合到同一个时间点,拉高了均值统计的结果。
2. 两份图表的准确性判定
两份图表均无偏差,只是统计口径完全不同,分别对应了你各自配置的统计规则的真实结果:
- Endpoints控制台输出的是你所选的「分响应码的中位数延迟」的准确值
- Metrics Explorer输出的是你配置的「全响应码混合的1分钟粒度均值延迟」的准确值
你感知的差异是配置的统计规则不匹配导致的,不是数据本身错误。
3. Metrics Explorer的正确配置方式
若要复现Endpoints控制台的中位数延迟指标,配置如下:
- 资源类型:
Produced API - 指标:
Request latencies(对应指标名serviceruntime.googleapis.com/api/produced/latencies) - 过滤器:
service = my-clint-eastwood-api.endpoints.project-western.cloud.goog- 可按需添加
response_code_class过滤对应响应码分类(如2xx、3xx等)
- 聚合器:选择
50th percentile(即中位数,不要选mean) - 最小对齐周期:设置为10秒(和Endpoints控制台默认对齐窗口一致)
若要统计准确的平均延迟指标,配置如下:
- 在前述配置基础上,将聚合器调整为
mean即可,可根据你的监控需求调整对齐周期(如需看更平滑的趋势可设为1分钟,如需看尖峰可设为更细粒度) - 若不需要把错误请求的延迟计入平均,可添加过滤器排除4xx、5xx响应码,避免错误请求拉高平均延迟数值。
内容的提问来源于stack exchange,提问作者Germs
相关产品推荐
相关产品推荐

