You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

非凸函数中梯度下降(含SGD)收敛至临界点或极值的场景问询

嗨,咱们来好好拆解你关于非凸函数上梯度下降(包括随机梯度下降SGD)收敛性的问题——这是机器学习优化领域的核心话题之一,能深挖这些细节真的很赞!

1. 非凸函数下,梯度下降何时会收敛至临界点、局部最小值或全局最小值?

咱们按不同的收敛目标逐一说明:

  • 临界点:如果目标函数是Lipschitz连续可微的,并且选择合适的步长(比如固定步长小于(2/L),其中(L)是梯度的Lipschitz常数;或者采用递减步长,比如第(t)次迭代用(1/t)),标准梯度下降几乎必然会收敛到临界点(即梯度范数趋近于0的点)。这是因为每一步的损失下降量和梯度大小直接相关,随着迭代推进,梯度范数会逐渐衰减至0。
  • 局部最小值:要收敛到局部最小值,光到达临界点还不够——因为临界点也可能是鞍点或局部最大值。如果满足额外条件,比如函数满足局部Polyak-Lojasiewicz(PL)条件(用梯度范数约束当前损失与局部最小值的差距),或者借助随机性(比如SGD自带的噪声)逃离鞍点,梯度下降就能收敛到局部最小值。如果没有这些辅助手段,普通梯度下降可能会卡在鞍点。
  • 全局最小值:在一般的非凸函数中,梯度下降几乎无法保证收敛到全局最小值。只有当函数具备特殊结构时才有可能,比如全局最小值是唯一的临界点,或者函数满足某种全局强凸性的变体——但这类场景在实际中非常少见。
2. 目前已知哪些场景下,可证明梯度下降(含随机梯度下降SGD)在非凸函数中收敛至临界点、局部最小值或全局最小值?

以下是有严谨证明的核心场景:

  • 梯度下降收敛至临界点:当目标函数是Lipschitz连续可微的,且步长选择恰当(固定步长足够小,或采用递减步长),可以证明梯度范数会收敛到0,即梯度下降最终到达临界点。
  • SGD收敛至临界点:对于SGD,若目标函数是Lipschitz连续可微的,步长遵循递减策略(比如(1/\sqrt{t})),随机梯度的期望等于真实梯度,且随机梯度的方差有界,可证明梯度范数的期望收敛到0,或者SGD几乎必然收敛到临界点。
  • SGD逃离鞍点并收敛至局部最小值:SGD的随机噪声天然有助于逃离鞍点的平坦区域。在所有鞍点都是严格鞍点(即Hessian矩阵至少有一个负特征值)的假设下,可以证明SGD几乎必然会摆脱鞍点,最终收敛到局部最小值。
  • 具备特殊结构的非凸函数:
    • 低秩矩阵恢复问题:在特定条件下(比如精确恢复的假设),可证明GD/SGD能收敛到全局最小值。
    • 宽度足够的神经网络:在合适的初始化和步长策略下,部分损失函数对应的GD/SGD可以收敛到全局最小值。
    • 弱凸函数:这类函数可以表示为凸函数加上一个小的非凸扰动,配合恰当的步长,GD/SGD能收敛到临界点甚至局部最小值。
  • 带扰动的梯度下降:给标准梯度下降加入小的随机扰动(模拟SGD的噪声),在所有鞍点都是严格鞍点的前提下,可证明其收敛到局部最小值。

内容的提问来源于stack exchange,提问作者gradstudent

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 04:25:47