在RTX 3070上使用TensorFlow 1.5.0训练ResNet50报SGEMM错误如何解决?
错误核心原因
- 最主要的原因是TensorFlow版本与RTX 3070显卡架构不兼容:RTX 3070属于安培架构显卡,最低要求CUDA 11.0版本才能支持GPU加速,而你使用的
tensorflow/tensorflow:1.5.0-gpu-py3镜像内置CUDA 9.0版本,完全不支持安培架构,调用GPU计算核心时触发BLAS库报错。 - 次要原因可能为GPU显存不足:训练ResNet50时如果batch size设置过大、或者显存被其他进程占用,也会触发SGEMM矩阵计算启动失败的报错。
- 边缘原因是NVIDIA Docker运行环境配置异常:如果宿主机没有正确安装nvidia-container-toolkit,容器内无法正常调用GPU硬件,也会触发该类错误。
解决方案
- 优先更换适配30系显卡的Docker镜像:放弃使用TensorFlow 1.5版本,选择内置CUDA 11+的TensorFlow镜像,例如
tensorflow/tensorflow:2.6.0-gpu-jupyter,对应CUDA 11.2版本,完美支持RTX 3070显卡,启动容器的参数除镜像名外其余可保持不变。 - 若必须保留TensorFlow 1.5版本运行环境:仅能更换为10系、20系等支持CUDA 9.0的旧架构显卡使用,30系及以上新架构显卡无法兼容旧版本CUDA。
- 排查显存占用问题:先在宿主机执行
nvidia-smi查看显存使用情况,关闭占用显存的多余进程,也可将训练代码的batch_size调低到8或4测试是否能正常运行。同时可在训练代码开头添加显存动态分配配置,避免TensorFlow一次性占用全部显存:
import tensorflow as tf config = tf.ConfigProto() config.gpu_options.allow_growth = True sess = tf.Session(config=config)
- 修复Docker GPU运行环境:如果在容器内执行
nvidia-smi无法识别到显卡,重新安装nvidia-container-toolkit,重启Docker服务后再启动容器测试。
内容的提问来源于stack exchange,提问作者ambigus9
相关产品推荐
相关产品推荐

