GCP Storage Transfer Service未发布传输任务的error_count错误计数指标
问题排查:GCS Transfer Service
storage_transfer_job.error_count 指标不更新 1. 先明确指标统计范围
storage_transfer_job.error_count 只统计传输服务层面的致命任务级错误,不是所有失败场景都会触发:
- 你遇到的对象缺失、单对象权限不足这类单个对象级别的失败,默认不会计入该指标,只会出现在任务的详细运行报告或日志里
- 只有像传输服务无法连接到存储系统、任务配置完全无效这类导致整个任务无法推进的全局错误,才会让这个指标递增
2. 检查指标过滤维度是否正确
在Cloud Monitoring查看指标时,必须确保过滤条件匹配你的任务:
- 要指定正确的
job_name维度(对应你的传输任务ID) - 确认聚合方式(比如选
sum)和时间范围设置合理,避免因为时间窗口太小没捕捉到数据
3. 换方式监控单个对象失败
如果需要监控对象级别的传输失败,别依赖error_count,可以用这两种方式:
- 直接看任务详情:在Cloud Console的Transfer Service页面,找到对应任务后点击「查看详情」,里面会列出所有失败的对象和具体原因
- 配置日志告警:把Transfer Service的日志导出到Cloud Logging,然后创建基于日志内容的告警规则(比如匹配包含错误关键词的日志条目)
4. 排查指标延迟或权限问题
- Cloud Monitoring指标通常有1-5分钟的上报延迟,错误发生后别立刻查看,等几分钟再刷新页面
- 确认你的项目已启用Cloud Storage Transfer API,且用于查看监控的账号拥有
monitoring.viewer及以上权限
5. 排查是否为服务端Bug
如果以上步骤都确认没问题,但指标还是不更新,大概率是服务端的指标上报Bug:
- 可以在Google Cloud的Issue Tracker中搜索相关问题,看是否有其他用户遇到相同情况
- 联系Google Cloud支持,提供你的任务ID、错误发生时间和日志片段,让官方排查定位
内容的提问来源于stack exchange,提问作者Pranav Bansal
相关产品推荐
相关产品推荐

