You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何离线计算神经网络的反向传播(backpropagation)

离线(全批量)反向传播核心逻辑

离线反向传播和你熟悉的在线(单样本)反向传播的核心差异只在梯度的聚合时机,核心流程如下:

  • 前向传播阶段:将所有N个样本依次输入网络,分别计算每个样本的前向输出与对应损失,最终得到全量样本的平均损失,用平均损失可以避免梯度数值随样本量增大而异常膨胀。
  • 反向传播阶段:对每个样本单独走一遍反向传播的梯度计算流程,对每一层的权重、偏置的梯度做累加,所有样本计算完成后将累加的梯度除以样本总数N,得到最终的平均梯度。
  • 参数更新阶段:使用上面得到的平均梯度,一次性更新所有权重和偏置参数。

用你构造的两层网络为例:假设你现在有50个训练样本,只需要把50个样本各自计算对w1、w2、偏置项的梯度后累加求平均,再用这个平均梯度统一更新参数即可,不需要每计算一个样本的梯度就更新一次参数。

学习方向建议

  • 先明确批量梯度下降(Batch Gradient Descent, BGD)的优化逻辑,离线反向传播本质就是BGD对应的梯度计算环节,二者是配套使用的。
  • 可以先用numpy手动实现全量反向传播的Demo,就用你现在构造的这个小网络,生成10个以内的样本手动走一遍全量梯度计算流程,对比单样本更新和全量更新的结果差异,能快速理解逻辑。
  • 进阶可以看主流深度学习框架的batch梯度实现逻辑,比如PyTorch中调用loss.mean()后再执行反向传播,本质就是离线/批量反向传播的标准实现方式。

内容的提问来源于stack exchange,提问作者Lucian

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 15:06:05