如何实现Docker容器内部服务卡死时自动触发重启?
容器内部服务故障自动重启解决方案
你当前遇到的是Docker仅感知容器主进程状态、无法识别内部服务可用性的典型场景,可通过以下两种方案实现异常自动重启:
方案1:Docker原生健康检查(推荐)
该方案适配你现有docker-compose部署架构,无需复杂开发,配置即可生效:
- 核心原理:Docker定期执行你定义的服务可用性探测命令,连续失败超过阈值后会将容器标记为unhealthy状态,配合监控组件即可触发自动重启
- docker-compose.yaml配置示例:
version: '3.8' services: postgres: image: postgres:12 restart: always # PostgreSQL健康检查,调用官方自带的pg_isready工具探测服务可用性 healthcheck: test: ["CMD-SHELL", "pg_isready -U 替换为你的数据库用户名 -d 替换为你的业务库名 || exit 1"] interval: 60s # 每60秒检查一次 timeout: 10s # 单次检查超时时间10秒 retries: 3 # 连续失败3次则标记为异常 start_period: 120s # 服务启动后120秒再开始检查,避免启动过程误判 guacd: image: guacamole/guacd restart: always healthcheck: test: ["CMD-SHELL", "nc -z localhost 4822 || exit 1"] # 探测guacd默认端口是否存活 interval: 30s timeout: 5s retries: 3 start_period: 60s guacamole: image: guacamole/guacamole restart: always healthcheck: test: ["CMD-SHELL", "curl -f http://localhost:8080/guacamole/ || exit 1"] # 探测Guacamole web页面是否可访问 interval: 30s timeout: 10s retries: 3 start_period: 90s # 新增autoheal组件,自动重启状态为unhealthy的容器,轻量无额外依赖 autoheal: image: willfarrell/autoheal restart: always volumes: - /var/run/docker.sock:/var/run/docker.sock environment: - AUTOHEAL_INTERVAL=30 # 每30秒检查一次所有容器的健康状态 - AUTOHEAL_START_PERIOD=120 # 服务启动后120秒再开始检查
方案2:自定义监控脚本(适配你的特殊判定规则)
如果你需要按照无新日志生成、无新请求进入的规则判定异常,可以自己开发监控脚本,配置定时任务执行:
- 核心逻辑:
- 用
docker inspect --format='{{.LogPath}}' 容器名获取容器的日志文件路径 - 用
stat -c %Y 日志文件路径获取日志最后修改时间,和当前时间对比,超过你设定的阈值(比如10分钟无更新)则判定为异常 - 若需要检测请求量,可以对接你服务的访问日志统计周期内的请求数,无新增则判定为异常
- 判定异常后执行
docker restart 容器名完成重启
- 用
- 脚本可直接放到crontab中定期执行,示例crontab配置:
*/5 * * * * /bin/bash /path/to/your/monitor_script.sh > /var/log/container_monitor.log 2>&1
注意事项
- 所有检查阈值需要根据你的业务特性调整,比如PostgreSQL执行大查询的最长耗时要高于健康检查的timeout时间,避免正常业务被误判中断
- 不要设置过短的检查间隔,避免给服务带来额外的性能压力
- 建议先在测试环境验证规则准确性,再上线到生产环境
内容的提问来源于stack exchange,提问作者Batchen Regev
相关产品推荐
相关产品推荐

