神经网络权重含义、正负值意义及重要性定义
预训练神经网络权重的含义与重要性说明
权重正负值的实际意义
权重的本质是跨神经元连接的信号缩放系数,对应当前层神经元j和前一层神经元i之间的连接权重w_ij,正负只代表信号作用的方向,没有天然的"好坏"属性:
- 权重为正:两个神经元呈正向激活关联。前一层i神经元的输出越高,经过权重缩放后,对当前层j神经元的激活促进作用越强。比如图像分类任务中,"猫"类别输出神经元和"检测到尖耳"特征神经元之间的权重通常为正,尖耳特征响应越强,越支持"当前输入是猫"的判断。
- 权重为负:两个神经元呈反向抑制关联。前一层i神经元的输出越高,经过权重缩放后,对当前层j神经元的激活抑制作用越强。还是用猫分类举例,"猫"输出神经元和"检测到轮胎"特征神经元之间的权重通常为负,轮胎特征响应越强,越会压低"当前输入是猫"的得分。
负权重不是训练失败的产物,模型区分类别、过滤无关特征的能力很大程度上靠负权重实现,和正权重同等重要。
权重离0越远,重要性越高吗?
这个结论绝大多数场景下都不成立,绝对不能直接拿权重绝对值大小跨位置、跨层比较重要性。
权重的数值尺度受太多和重要性无关的因素影响:不同层的初始化策略差异(He/Xavier初始化会根据层的通道数自动调整初始权重尺度)、训练时权重衰减正则的强度差异、层后是否接归一化操作(接了BN层的卷积权重,数值尺度是和BN的可学习缩放系数耦合的,单独看卷积核权重大小没有任何意义)、连接的输入特征本身的尺度差异(比如接原始像素值的全连接层,像素值本身尺度在0-255,对应权重自然会比接归一化特征的权重小,和重要性无关)。
举个很直观的反例:ResNet里靠近输入的第一层卷积,权重绝对值普遍很小,但这层负责提取边缘、纹理等所有视觉任务通用的基础特征,要是把这些小权重全部置0,模型精度会直接跌到接近随机猜测,重要性远高于后面很多绝对值更大的深层权重。
神经网络中"重要权重"的实际定义
不存在脱离具体场景的通用"重要权重"标准,所有重要性判定的核心逻辑都是:改动这个权重,会对关心的目标产生多大影响,常见的定义分三类场景:
- 模型剪枝场景:重要性指权重的损失敏感度,也就是把该权重置0、或者施加微小扰动后,模型在验证集上的任务损失上升幅度越大,权重越重要。很多入门教程里说的"按权重绝对值剪枝"只是工程上的近似偷懒方案,只有在同层、同归一化组内的权重尺度一致时,绝对值大小才和敏感度正相关,跨层、跨结构直接比绝对值完全没有参考价值。
- 单样本预测归因场景:重要性指权重对某一条特定样本预测结果的贡献度,一般通过梯度、积分梯度等方法计算得到,这种重要性是和具体样本绑定的——同一个权重在判断一张猫的图片时可能是核心权重,在判断一张汽车图片时可能完全不参与计算,贡献为0。
- 预训练模型微调场景:重要性指权重承载的预训练知识量,一般用Fisher信息值衡量,值越高代表这个权重对预训练任务的效果贡献越大,微调时如果改动太大,很容易破坏模型学到的通用特征,导致效果下降。
内容的提问来源于stack exchange,提问作者chris4953
相关产品推荐
相关产品推荐

