为何神经网络权重正则化时不对偏置项进行正则化?
为什么深度学习中不对偏置项做参数范数惩罚?
嘿,刚好我也啃过Ian Goodfellow、Yoshua Bengio和Aaron Courville这本经典的《深度学习》,7.1节关于参数正则化的这段内容确实是很关键的细节,我来给你拆解清楚:
我们通常选择使用参数范数惩罚Ω,仅对每层仿射变换的权重进行惩罚,不对偏置项做正则化。偏置项通常比权重所需拟合数据更少,每个权重定义两个变量的交互方式,拟合权重需要观察两个变量在多种……
其实背后的逻辑很好理解,主要有这两个核心原因:
- 偏置的拟合需求远低于权重:偏置的作用只是给神经元输出加一个固定偏移,它不需要像权重那样捕捉不同输入变量之间的交互关系,只需要拟合数据的整体偏移趋势,需要的观测数据量很少,几乎不会出现过拟合的情况。
- 正则化偏置反而可能限制模型能力:如果给偏置加上参数范数惩罚,反而会约束模型调整基础偏移的能力,比如在简单分类任务里,偏置负责调整决策边界的位置,过度正则化它可能导致模型无法很好地匹配数据的分布,进而出现欠拟合。
内容的提问来源于stack exchange,提问作者roy
相关产品推荐
相关产品推荐

