You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为失败的Serverless Dataproc任务配置告警策略?

Serverless Dataproc任务失败告警配置问题排查

想要在Serverless Dataproc任务失败时触发告警,计划通过基于日志的指标+告警策略实现,但使用以下过滤器配置告警后,指标始终未处于活跃状态:

filter = "metric.type=\"logging.googleapis.com/log_entry_count\" resource.type=\"cloud_dataproc_batch\" metric.label.\"severity\"=\"ERROR\""

排查与解决步骤

  • 先验证原始日志是否存在:进入Cloud Logging,用resource.type="cloud_dataproc_batch" severity="ERROR"过滤日志,确认是否有符合条件的条目。如果没有,说明任务失败时未生成对应级别的日志,或者日志的资源类型不是cloud_dataproc_batch,需要先修正日志匹配条件。
  • 核对自定义日志指标配置:如果是手动创建的基于日志的指标,要确保指标的过滤器和告警策略中的完全一致,且指标确实在收集数据。可以到Cloud Monitoring的指标页面查看该指标是否有数据点生成。
  • 优化告警过滤器规则:默认的logging.googleapis.com/log_entry_count指标的severity标签可能无法精准匹配任务失败场景,建议结合日志内容细化过滤条件。比如任务失败时日志通常包含"Batch failed"关键词,可将指标过滤器调整为:
    resource.type="cloud_dataproc_batch" severity="ERROR" textPayload:"Batch failed"
    
  • 确认资源类型准确性:部分场景下,Serverless Dataproc的日志可能关联cloud_dataproc_cluster等其他资源类型,需核对日志详情中的resource.type字段,确保过滤器使用正确的类型值。
  • 检查指标活跃状态:在Cloud Monitoring的「指标资源管理器」中搜索该日志指标,确认是否有数据流入。若指标始终无数据,说明日志过滤器未匹配到任何日志,需重新调整过滤规则。

内容的提问来源于stack exchange,提问作者Daniel Fletemier

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 14:20:34