You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

TensorFlow大模型训练时GPU使用率极低问题求助

TensorFlow大模型训练时GPU活跃度骤降至2%的问题求助

问题现象

  • 使用TensorFlow训练参数超200万的模型,训练启动后GPU活跃度骤降至0%-2%,并持续维持该低水平
  • 开启tf.config.experimental.set_memory_growth(gpu, True)限制显存按需分配时,GPU活跃度仍为2%;关闭该设置后显存占用直接拉满至100%,但GPU活跃度无任何提升
  • TensorFlow可正常识别GPU,训练已启用tf.distribute.MirroredStrategy分布式策略

环境配置

  • TensorFlow:2.6.2(测试2.7版本结果一致)
  • CUDA:11.2
  • cuDNN:8.1
  • GPU:RTX 4080,驱动版本525.89.02
  • 系统:Ubuntu 22.04.2 LTS
  • 训练配置:batch size = 32,数据集配置.buffer(500)

已尝试的无效方案

  • 调整批次大小、缩小/扩大模型规模
  • 为数据集添加.prefetch(tf.data.experimental.AUTOTUNE)或自定义预取值,尝试解决CPU数据加载滞后问题
  • 在GTX 3070+TensorFlow 2.11环境下测试,问题复现

验证情况

运行TensorFlow小型基准测试模型时,GPU使用率可达约50%,GPU工作状态正常

训练开始时的nvtop GPU使用率图表

内容的提问来源于stack exchange,提问作者rémy Joseph

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 22:22:51