Ubuntu环境下Docker启动GPU容器报错:无法选择GPU驱动
排查Docker GPU驱动匹配问题的步骤
验证nvidia-container-toolkit配置生效
执行命令完成配置并重启Docker:nvidia-ctk runtime configure --runtime=docker systemctl restart docker检查Docker daemon配置文件
查看/etc/docker/daemon.json,确保包含以下内容(不存在则创建该文件):{ "runtimes": { "nvidia": { "path": "nvidia-container-runtime", "runtimeArgs": [] } }, "default-runtime": "nvidia" }修改后重启Docker:
systemctl restart docker确认驱动与container-toolkit版本兼容性
尝试升级nvidia-container-toolkit到适配当前CUDA驱动的版本:curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list sudo apt-get update sudo apt-get install -y nvidia-container-toolkit安装完成后重启Docker
检查内核模块加载状态
执行lsmod | grep nvidia,确认nvidia、nvidia_uvm、nvidia_drm等模块已加载。若未加载,手动执行modprobe nvidia,若报错则需确认NVIDIA驱动是否与当前内核(6.5.0-27-generic)匹配。使用匹配版本的容器镜像测试
换用与本地CUDA 12.4匹配的镜像测试:docker run --gpus all nvidia/cuda:12.4.0-base-ubuntu22.04 nvidia-smi验证Docker runtime识别情况
执行docker info | grep -i runtime,确认输出中包含nvidiaruntime,且默认runtime已设置为nvidia。检查用户Docker组权限
执行groups | grep docker,确认当前用户在docker组内。若不在,执行sudo usermod -aG docker $USER后重新登录会话。
内容的提问来源于stack exchange,提问作者DL-Newbie
相关产品推荐
相关产品推荐

