TensorFlow大模型训练时GPU使用率极低问题求助
TensorFlow大模型训练时GPU活跃度骤降至2%的问题求助
问题现象
- 使用TensorFlow训练参数超200万的模型,训练启动后GPU活跃度骤降至0%-2%,并持续维持该低水平
- 开启
tf.config.experimental.set_memory_growth(gpu, True)限制显存按需分配时,GPU活跃度仍为2%;关闭该设置后显存占用直接拉满至100%,但GPU活跃度无任何提升 - TensorFlow可正常识别GPU,训练已启用
tf.distribute.MirroredStrategy分布式策略
环境配置
- TensorFlow:2.6.2(测试2.7版本结果一致)
- CUDA:11.2
- cuDNN:8.1
- GPU:RTX 4080,驱动版本525.89.02
- 系统:Ubuntu 22.04.2 LTS
- 训练配置:
batch size = 32,数据集配置.buffer(500)
已尝试的无效方案
- 调整批次大小、缩小/扩大模型规模
- 为数据集添加
.prefetch(tf.data.experimental.AUTOTUNE)或自定义预取值,尝试解决CPU数据加载滞后问题 - 在GTX 3070+TensorFlow 2.11环境下测试,问题复现
验证情况
运行TensorFlow小型基准测试模型时,GPU使用率可达约50%,GPU工作状态正常

内容的提问来源于stack exchange,提问作者rémy Joseph
相关产品推荐
相关产品推荐

