Ubuntu 22.04 LTS下TensorFlow-GPU运行代码报错求助
Ubuntu 22.04 LTS下TensorFlow-GPU运行报错排查方案
基础环境校验步骤
- 检查GPU驱动状态:
nvidia-smi,确认输出正常且CUDA版本与TensorFlow要求匹配 - 验证版本兼容性:TensorFlow 2.x系列对CUDA/cuDNN版本有严格对应要求,比如2.15版本对应CUDA 12.3
- 确认虚拟环境隔离:执行
pip list | grep tensorflow,确保仅存在目标版本的TensorFlow包,无系统全局包干扰
常见报错修复方案
显存分配失败报错
运行以下代码强制开启显存动态增长:
import tensorflow as tf gpus = tf.config.list_physical_devices('GPU') if gpus: try: for gpu in gpus: tf.config.experimental.set_memory_growth(gpu, True) logical_gpus = tf.config.list_logical_devices('GPU') print(len(gpus), "Physical GPUs,", len(logical_gpus), "Logical GPUs") except RuntimeError as e: print(e)
CUDA库加载失败报错
- 检查环境变量配置,终端执行:
输出需包含CUDA安装路径下的echo $LD_LIBRARY_PATH echo $CUDA_HOMElib64和bin目录 - 若未配置,在
~/.bashrc中添加以下内容(替换xxx为实际CUDA版本号):
执行export CUDA_HOME=/usr/local/cuda-xxx export LD_LIBRARY_PATH=$CUDA_HOME/lib64:$LD_LIBRARY_PATH export PATH=$CUDA_HOME/bin:$PATHsource ~/.bashrc使配置生效
依赖冲突报错
- 完全卸载现有TensorFlow:
pip uninstall -y tensorflow-gpu tensorflow - 清理pip缓存:
pip cache purge - 重新安装对应版本:
pip install tensorflow==2.15(根据CUDA版本选择匹配的TensorFlow版本)
注意:当前TensorFlow已不再区分
tensorflow和tensorflow-gpu包,安装tensorflow即可自动适配GPU环境,无需单独安装tensorflow-gpu
内容的提问来源于stack exchange,提问作者Chamith Dilshan
相关产品推荐
相关产品推荐

