如何使用DataDog监控AWS ECS集群中陷入重启循环的容器
Datadog识别AWS ECS重启循环容器方案
核心监测配置
- 调用
docker.container.restart.count内置指标,按ecs_cluster、ecs_task_definition、docker_container维度做分组聚合 - 配置5分钟滚动窗口内重启次数≥3的阈值规则,即可覆盖绝大多数短时间反复重启的异常场景
- 补充
aws.ecs.task.desired_running与aws.ecs.task.running的差值监控,同一任务定义下差值持续大于0,说明有任务始终无法正常拉起进入稳态
针对短生命周期崩溃容器的补充规则
针对120秒自动崩溃的测试场景,可额外配置运行时长异常校验:
- 基于
aws.ecs.task.start_time指标计算任务运行时长,设置最小正常运行阈值(该场景可设为180秒) - 同一任务定义下,5分钟内出现≥2个运行时长低于阈值的退出任务,即可判定为进入重启循环
现有指标参考


内容的提问来源于stack exchange,提问作者Eyal Solomon
相关产品推荐
相关产品推荐

