求助:Colab Pro GPU通过colab-ssh在本地VSCode内存显示异常
解决Colab SSH连接后nvidia-smi内存显示"Function Not Found"的问题
通过colab-ssh+ngrok在本地VSCode连接Colab Pro GPU资源时,执行nvidia-smi命令后,Memory-Usage项显示Function Not Found,具体输出如下:
Sat Jul 16 04:08:30 2022 +-----------------------------------------------------------------------------+ | NVIDIA-SMI 515.48.07 Driver Version: 460.32.03 CUDA Version: 11.2 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 Tesla P100-PCIE... Off | 00000000:00:04.0 Off | 0 | | N/A 35C P0 29W / 250W | Function Not Found | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+
解决方法
直接查询GPU内存数值:绕过表格显示问题,用命令直接输出内存使用情况:
nvidia-smi --query-gpu=memory.used,memory.total --format=csv,noheader,nounits该命令会直接返回已用/总内存数值,无需依赖表格渲染。
使用替代工具监控GPU:安装
nvtop工具,它是更直观的GPU监控工具,不会出现这类显示问题:
先在Colab网页端的代码单元格中执行:!apt update && !apt install -y nvtop再在VSCode的SSH终端中运行
nvtop,即可查看完整的GPU内存、使用率等信息。重新加载GPU相关模块:在SSH终端执行以下命令(Colab环境无需sudo权限):
rmmod nvidia_uvm && modprobe nvidia_uvm重新加载UVM模块后,再次运行
nvidia-smi尝试恢复显示。确认GPU会话状态:回到Colab网页端,在代码单元格中执行
!nvidia-smi确认GPU是否正常分配。若显示正常,断开当前SSH连接并重新连接,确保会话同步。修复环境变量:在SSH终端中手动设置NVIDIA相关环境变量:
export PATH=/usr/local/nvidia/bin:$PATH export LD_LIBRARY_PATH=/usr/local/nvidia/lib64:$PATH设置完成后重新运行
nvidia-smi。
内容的提问来源于stack exchange,提问作者ram
相关产品推荐
相关产品推荐

