感知机模型:权重全零初始化时学习率影响与向量夹角关联问题

这个逻辑不需要复杂的三角、代数基础,对应感知机更新规则和向量基本性质就能完全理清楚:
核心逻辑拆解
两个基础前提
- 感知机错分样本时的权重更新规则:
w_new = w_old + η * (y_true - y_pred) * x
其中η是学习率,为正的常数标量;y_true - y_pred是标签差,错分时是固定非零值(二分类场景下通常为±2或±1,和学习率无关);x是当前错分样本的特征向量。 - 向量夹角的基本性质:如果向量A = 正标量k * 向量B,那么A和B方向完全一致,夹角为0。本质就是把一个箭头等比例拉长/缩短、不调转方向,箭头指向不会变,和原向量的夹角自然为0。
全零初始化的特殊性质
如果初始权重w_old是全零向量,第一次更新权重时公式会直接简化为:w_first = 0 + η * (y_true - y_pred) * x = η * delta * x
其中delta = y_true - y_pred是固定标量,x是固定的样本向量。
这时候你得到的第一次更新后的权重w_first,本质就是固定向量delta*x乘了正标量η——这就是原书提到“两向量夹角为0”的含义:不管你把η设为0.001、0.1还是10,w_first的方向永远和delta*x完全一致,夹角为0,η只改变权重向量的长度,完全不影响方向。
和学习率作用效果的关联
我们设置学习率的核心目的,是控制每次权重更新的步长,避免更新幅度过大跨过最优分类边界、或者幅度过小导致收敛过慢。但全零初始化会打破这个设计逻辑:
- 第一次权重更新的方向完全被锁死,和η的取值没有任何关系,η根本无法调节第一次更新的方向,只能缩放权重的模长
- 这种情况下初始权重的方向完全由训练时遇到的第一个错分样本决定,相当于给模型引入了无意义的初始偏置,也会让学习率在训练初始阶段失去对更新方向的调控能力,这也是原书不推荐全零初始化感知机权重、建议初始化为小随机值的核心原因。
内容的提问来源于stack exchange,提问作者Khanh Tran
相关产品推荐
相关产品推荐

