Kubernetes Pod/容器部署意外启动失败,微小变更后Pod异常报错求助
oom_score_adj无效参数错误 首先,先明确你遇到的错误信息:
Warning Failed 14s kubelet, ip-10-166-30-232.ec2.internal Error: failed to start container "": Error response from daemon: oci runtime error: container_linux.go:247: starting container process caused "process_linux.go:295: setting oom score for ready process caused "write /proc/11890/oom_score_adj: invalid argument""
这个问题我之前处理过好几次,核心原因大多是尝试设置超出Linux系统允许范围的OOM分数调整值,或是容器运行时/内核的兼容性问题。下面是一步步的排查和解决方法:
1. 优先检查oomScoreAdj配置值
Linux系统规定oom_score_adj的合法取值范围是**-1000到1000**,如果你的Pod/Deployment的securityContext里设置了超出这个范围的值(比如1001、-1001),kubelet启动容器时就会触发这个错误。
排查步骤:
- 导出当前Deployment的配置文件:
kubectl get deployment <你的deployment名称> -o yaml > deployment.yaml - 打开文件搜索
oomScoreAdj,确认值是否在合法区间内。
修复示例:
错误配置(会触发问题):
spec: template: spec: securityContext: oomScoreAdj: 1001 # 超出允许范围
正确配置:
spec: template: spec: securityContext: oomScoreAdj: 500 # 取值在-1000到1000之间
2. 检查容器运行时版本
如果oomScoreAdj值是合法的,那可能是Docker/containerd这类容器运行时的旧版本bug导致的。比如某些早期的Docker版本(<18.09)在处理oomScoreAdj时存在兼容性问题,升级到稳定版就能解决。
排查步骤:
- 在节点上运行
docker version或者containerd --version查看版本,对比Kubernetes官方推荐的兼容版本。 - 如果版本过旧,升级到对应Kubernetes版本支持的稳定容器运行时版本。
3. 检查节点内核版本
某些非常老旧的Linux内核(比如3.10以下的部分版本)对/proc/[pid]/oom_score_adj的写入逻辑有问题,也会触发这个错误。
排查步骤:
- 在节点上运行
uname -r查看内核版本。 - 如果版本过低,升级到对应发行版的稳定内核(比如CentOS 7升级到3.10.0-1160以上的版本)。
4. 检查自定义镜像的启动脚本
如果你用的是自定义构建的容器镜像,要检查镜像里的启动脚本有没有手动修改/proc/self/oom_score_adj的操作,可能脚本里写了非法值。
排查步骤:
- 拉取镜像到本地:
docker pull <你的镜像地址> - 进入镜像查看启动脚本:
docker run --rm -it <镜像地址> /bin/bash,然后检查entrypoint.sh或者cmd里的相关命令。
5. 临时应急恢复
如果需要紧急恢复服务,可以先移除oomScoreAdj的配置,让系统使用默认值(默认是0),先让Pod启动起来,之后再慢慢排查根本原因。
内容的提问来源于stack exchange,提问作者Bryji

