EC2 Micro实例突发持续100% CPU占用且无法远程连接问题排查求助
EC2 Micro实例突发持续100% CPU占用且无法远程连接问题排查求助
各位好,想请教大家一个困扰我很久的问题:
我在AWS EC2微型实例(1GB内存)上部署了两个服务:一个用PM2管理的Node.js服务(设置了500MB内存上限),还有一个Docker运行的PostgreSQL。平时运行非常稳定,经常一跑就是几周甚至几个月,但偶尔会毫无征兆地出现CPU直接拉满到100%的情况,而且会一直保持这个状态,直接把实例资源耗尽——SSH连不上,手动重启也没反应,最后只能销毁实例重新部署。
发生问题的时候,我查过网络流量,当时流量很低,所以应该不是爬虫或者DoS攻击搞的鬼。
我自己猜测会不会是内存耗尽后触发了swap,导致CPU被交换操作拖垮?毕竟实例只有1GB内存,Node.js服务平时内存占用也就100MB左右,按说PM2的自动重启机制应该能避免内存泄漏,但突然用到1GB内存的情况我实在找不到原因。
我也试着去看syslog,但完全不知道该重点关注哪些日志条目,现在彻底没头绪了。有没有大佬能给我一些排查方向或者具体的建议?
备注:内容来源于stack exchange,提问作者C5H8NNaO4
相关产品推荐
相关产品推荐

