多GPU环境下PyTorch非预期数据重复问题求助
双Quadro P6000 GPU环境下PyTorch显存异常占用问题
我在配备2块Quadro P6000 GPU的设备上使用PyTorch时遇到异常:当两块GPU显存均为空时,执行以下代码:
Python 3.11.6 | packaged by conda-forge | (main, Oct 3 2023, 10:40:35) [GCC 12.3.0] on linux Type "help", "copyright", "credits" or "license" for more information. >>> import torch >>> dev = torch.device('cuda:0') >>> a = torch.rand(1000,1000,1000, device=dev)
明明指定将张量a创建在cuda:0设备上,却发现该张量同时占用了两块GPU的显存。相同代码在另一硬件配置相似的设备上无此问题。
故障设备的环境配置如下:
GPU: Quadro P6000 (2x) $ conda list torch* # packages in environment at ....: # # Name Version Build Channel pytorch 2.1.0 py3.11_cuda11.8_cudnn8.7.0_0 pytorch pytorch-cuda 11.8 h7e8668a_5 pytorch pytorch-mutex 1.0 cuda pytorch torchaudio 2.1.0 py311_cu118 pytorch torchtriton 2.1.0 py311 pytorch torchvision 0.16.0 py311_cu118 pytorch
更新:我已通过C程序调用cudaMalloc验证,确认此为CUDA层面的问题。
内容的提问来源于stack exchange,提问作者Emoticon
相关产品推荐
相关产品推荐

