使用RAPIDS的cuml库时遭遇CUDA RuntimeError问题求助
问题排查与解决步骤
1. 检查Docker容器启动命令的GPU权限
确保启动容器时添加GPU访问参数,否则容器无法调用NVIDIA GPU:
正确启动命令示例:
docker run --gpus all -it --rm nvcr.io/nvidia/rapidsai/rapidsai-core:22.10-cuda11.5-runtime-ubuntu20.04-py3.9
若之前启动未加--gpus all,重新启动容器后再测试代码。
2. 验证WSL2与Windows的NVIDIA驱动兼容性
- Windows侧需安装支持CUDA 11.5的NVIDIA驱动(GeForce 1080对应的最低驱动版本为495.29.05)
- 在WSL2终端运行
nvidia-smi,确认输出包含GPU信息且驱动版本符合要求
3. 确认容器内的GPU访问正常
进入容器后执行nvidia-smi,若能正常显示GPU信息,说明GPU passthrough配置正常;若无输出或报错,需检查WSL2的Docker GPU支持配置:
- 确保已安装
nvidia-docker2工具包 - 重启Docker服务:
sudo systemctl restart docker
4. 排查GPU内存或架构兼容性问题
- 尝试减小测试样本量,将
n_samples改为10000,运行代码看是否报错,排除内存不足导致的CUDA上下文创建失败 - GeForce 1080为Pascal架构(sm_61),RAPIDS 22.10支持该架构,若上述步骤无效,可尝试更换为CUDA 11.4版本的RAPIDS镜像:
nvcr.io/nvidia/rapidsai/rapidsai-core:22.10-cuda11.4-runtime-ubuntu20.04-py3.9
5. 验证CUDA运行时可用性
在容器内运行以下代码,检查CUDA是否能正常初始化:
import cupy print(cupy.cuda.runtime.getDeviceCount())
若输出为1(对应你的1080 GPU),说明CUDA环境正常;若输出0,说明容器无法识别GPU,需回到步骤1-3排查。
内容的提问来源于stack exchange,提问作者Chao Li
相关产品推荐
相关产品推荐

