是否存在选择合适batch size的有效规则?
Batch Size设置的实用建议
- 业内常用的一个启发式思路是让batch size尽可能匹配你的加速硬件上限——直接拉满到硬件能支持的最大规模,这样能把GPU/TPU这类加速硬件的并行计算能力榨到极致。
- 但要注意一个例外场景:如果是在小规模数据集上用超大batch size训练,反而会变得非常低效。因为小数据集本身样本量少,大batch size会让每个epoch的训练步数变得极少,模型得不到足够次数的参数更新,最终会拖慢甚至阻碍训练收敛,达不到理想的训练效果。
内容的提问来源于stack exchange,提问作者Santiago Cortes
相关产品推荐
相关产品推荐

