Amazon ECS容器部署后CPU使用率异常问题排查求助
Amazon ECS容器部署后CPU使用率异常问题排查求助
大家好,我是AWS新手,最近碰到了一个百思不得其解的问题,想请各位帮忙分析排查下:
事件背景
昨天我给测试环境的某服务部署了新版本,这个版本只调整了日志配置——换成了输出logstash json格式的新编码器,完全没有改动业务逻辑。而且现在大部分同事在放假,这个容器的日常使用率很低。
问题经过与现象
- 首次部署新版本时,因为健康检查连续两次失败,直接导致部署超时(当时尝试启动两个实例)
- 我把健康检查等待时间增加了30秒后重试,部署过程中CPU直接拉满到100%,卡了很久才稳定下来;稳定后CPU在0%-10%之间大幅波动,状态很不稳定
- 我以为是新版本的问题,立刻回滚到了之前运行正常的旧镜像,但同样的异常还是出现了:部署时CPU飙升至100%,稳定后维持在10%左右的负载,一整晚过去今天早上还是这个状态
- 有个奇怪的例外:服务本身功能完全正常,API查询响应很快,没有业务层面的问题
补充信息
我们使用ECS来运行任务,监控图的情况如下:
- 今早的健康监控图:平稳段是原任务正常运行状态,第一个峰值对应部署新版本,第二个峰值对应回滚旧版本
- 还有一张更长时间跨度的监控图,趋势和上述一致
实在搞不懂,旧镜像之前运行好好的,为什么部署新版本再回滚后就出现CPU异常了?有没有大佬能指点下可能的原因或者排查方向?
备注:内容来源于stack exchange,提问作者mal
相关产品推荐
相关产品推荐

