You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS Batch作业状态未在CloudWatch Metrics中显示的问题排查

解决AWS Batch CloudWatch命名空间缺失问题及配置告警方案

排查CloudWatch指标缺失的步骤

  • 验证Batch服务角色权限
    确保AWS Batch的服务角色(默认是AWSBatchServiceRole)拥有cloudwatch:PutMetricData权限。检查角色的附加策略,确认包含以下权限片段:

    {
        "Effect": "Allow",
        "Action": "cloudwatch:PutMetricData",
        "Resource": "*"
    }
    

    若自定义了策略,需补充该权限,否则Batch无法将指标推送至CloudWatch。

  • 查询指定维度的指标
    全局查询返回空时,尝试指定作业队列维度缩小范围,执行命令:

    aws cloudwatch list-metrics --namespace AWS/Batch --dimensions Name=JobQueue,Value=TeamIdJobQueue-xx --region us-east-2
    

    若返回结果,说明指标存在但未在全局列表中显示(可能是缓存或维度过滤问题)。

  • 等待指标同步延迟
    CloudWatch指标通常有5-10分钟的同步延迟,若作业刚完成不久,等待一段时间后再重试list-metrics命令。

  • 提交测试作业触发指标推送
    手动提交一个简单测试作业(如echo "test"),等待作业进入SUCCEEDED状态后,再次检查CloudWatch指标,强制触发Batch的指标推送逻辑。

  • 确认作业队列区域一致性
    执行以下命令确认作业队列所在区域与查询区域完全匹配:

    aws batch describe-job-queues --job-queues TeamIdJobQueue-xx --region us-east-2
    

配置CloudWatch+SNS告警步骤

当指标正常显示后,按以下步骤配置告警:

  1. 登录CloudWatch控制台,切换至us-east-2区域,进入指标 > 全部指标 > AWS/Batch。
  2. 选择对应维度(如JobQueue),选中需监控的指标(如JobFailed、JobSucceeded)。
  3. 点击创建告警,设置告警阈值(例如:5分钟内JobFailed计数大于0)。
  4. 在通知部分,选择已有的SNS主题,或创建新主题并添加接收告警的邮箱/终端。
  5. 完成配置并保存,触发阈值时即可收到SNS通知。

内容的提问来源于stack exchange,提问作者Matt Winer

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.12 20:22:12