AWS EC2 Ubuntu实例因PARTUUID自动变更导致重启失败的排查求助
AWS EC2 Ubuntu实例因PARTUUID自动变更导致重启失败的排查求助
各位技术同仁,想请教一个困扰我们团队的问题:
我们有一台运行在AWS云上的EC2实例,具体配置如下:
- 操作系统:Ubuntu 22.04.1 LTS
- AMI ID:
ami-07651f0c4c315a529 - AMI名称:
ubuntu/images/hvm-ssd/ubuntu-jammy-22.04-amd64-server-20220912 - 实例类型:t3a.medium
实例上部署了PostgreSQL 14,并安装了TimescaleDB扩展。最近遇到一个奇怪的问题:偶尔会因为OOM Killer触发系统重启,但重启时会失败,报错提示PARTUUID不存在。
第一次出现这个问题时,我们排查发现/boot/grub/grub.cfg中配置的PARTUUID和通过blkid命令查询到的磁盘分区实际PARTUUID不一致。当时以为是偶发异常,我们采取的解决办法是:将该实例的EBS卷卸载,挂载到一台救援EC2实例上,修改grub.cfg中的PARTUUID为正确值,之后重新挂载回原实例,系统就能正常启动了。
但现在这个问题会不定期复发,我们已经联系了AWS官方支持,对方表示AWS的系统更新和补丁操作不会影响PARTUUID,目前我们陷入了排查瓶颈,想问问有没有遇到过类似问题的同仁,能给一些排查方向或解决思路?
备注:内容来源于stack exchange,提问作者Kent Ho
相关产品推荐
相关产品推荐

