经典gradient descent algorithm属于batch还是sequential模式?二者有何区别?
嘿,刚好帮你理清这个梯度下降模式的问题~
你学的经典gradient descent algorithm(梯度下降算法)属于batch(批量)模式,也就是我们常说的Batch Gradient Descent(BGD)。下面我给你掰扯清楚batch和sequential两种模式的核心区别:
Batch(批量)模式(BGD)
- 每次更新模型参数时,会用整个训练数据集来计算损失函数的梯度。简单说就是把所有数据都过一遍,才调整一次参数。
- 👉 优点:
- 梯度计算特别稳定,因为用了全量数据,每次参数更新的方向更贴合全局最优的方向,损失曲线的下降也比较平滑
- 很容易判断模型有没有收敛,毕竟损失的变化不会太跳脱
- 👉 缺点:
- 数据集一大就拉胯,每次迭代都要跑完全部数据,计算慢还占内存,根本扛不住百万级甚至更大的数据集
- 要是碰到局部最优,大概率就卡那了,因为梯度方向太“平均”,没劲儿跳出去
Sequential(序列/随机)模式(通常指SGD)
这里的sequential其实更常用的名字是随机梯度下降(Stochastic Gradient Descent,SGD),每次只拿单个训练样本来算梯度、更参数:
- 简单说就是看一个样本,就调一次参数,迭代速度贼快
- 👉 优点:
- 计算量极小,内存占用低,超大数据集也能跑得动
- 因为每次的梯度是单个样本的“带噪声”梯度,反而有可能跳出局部最优坑,摸到更好的全局最优解
- 👉 缺点:
- 梯度波动特别大,损失函数的曲线会像坐过山车一样震荡,收敛过程特别不稳定
- 往往需要更多的迭代次数,才能晃悠到最优值附近
额外提一句:工程界的宠儿——小批量梯度下降
实际干活的时候,大家用得最多的其实是Mini-batch Gradient Descent,它取一小撮样本(比如32、64、128个)来算梯度,既兼顾了BGD的稳定性,又有SGD的高效性,算是两者的完美折中。
内容的提问来源于stack exchange,提问作者user9516512
相关产品推荐
相关产品推荐

