Azure NCasT4_v3系列虚拟机上PyTorch无法检测GPU求助
验证NVIDIA驱动与硬件状态
打开命令提示符执行nvidia-smi,确认能正常显示GPU型号、驱动版本、CUDA版本信息。若命令报错,按Azure N系列虚拟机驱动配置指南重新安装驱动;若驱动版本低于530.30.02(CUDA 12.1最低兼容驱动),需升级驱动。检查系统环境变量
确认系统环境变量中存在CUDA_PATH,指向CUDA 12.1安装目录(如C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1);同时Path变量需包含%CUDA_PATH%\bin和%CUDA_PATH%\libnvvp,缺失则手动添加后重启终端。核对conda环境的PyTorch配置
激活项目conda环境,执行conda list检查是否存在pytorch-cuda=12.1及匹配版本的pytorch、torchvision包。在Python环境中运行以下代码:import torch print(torch.version.cuda) print(torch.cuda.device_count()) print(torch.cuda.get_device_name(0) if torch.cuda.device_count() > 0 else "No GPU detected")若
torch.version.cuda不为12.1,卸载现有PyTorch相关包后重新执行官方安装命令。确认虚拟机GPU分配
登录Azure门户查看虚拟机规格,确认已分配T4 GPU;Windows系统下打开任务管理器“性能”标签,检查是否有NVIDIA GPU条目,若无则重启虚拟机或联系Azure支持确认硬件挂载状态。测试原生CUDA功能
进入CUDA 12.1安装目录下的samples文件夹,编译并运行deviceQuery示例程序。若示例无法识别GPU,说明CUDA本身安装异常,需重新安装CUDA 12.1。
内容的提问来源于stack exchange,提问作者Tom Wagstaff

