正则化回归后基于p值筛选变量的疑问及注意事项
嘿,咱们好好聊聊你关于正则化回归和p值的这些问题,一个个来拆解清楚:
正则化回归与p值的核心疑问解答
一、正则化回归后,还需要移除p值较低的变量吗?
得先搞明白:正则化(不管是L1的变量选择,还是L2的系数收缩)本身就是在帮我们处理变量的“有用性”问题——L1会直接把不重要的变量系数压到0,相当于自动筛掉;L2会把所有系数往0收缩,平衡变量的贡献。这时候再单独拿p值去筛选变量,其实有点多此一举,甚至可能搞砸模型的稳定性。毕竟正则化后的系数和普通OLS的系数逻辑完全不同,p值的计算基础也变了,强行移除低p值变量反而可能丢掉模型原本平衡好的信息。
二、高p值是不是意味着β只是偶然得到,实际为0?对应的变量该移除吗?
在普通OLS回归里,高p值(比如超过0.05)确实暗示“没有足够证据证明这个变量的系数不为0”,看起来这个变量好像没什么用。但放到正则化回归里,这个结论可不能随便下,有不少得谨慎对待的情况:
- 共线性坑:如果两个变量高度相关,正则化会收缩它们的系数,这时候其中一个的p值可能变得很高,但这绝对不代表它没用!实际上这俩变量共同承载了一部分信息,单独移除任何一个,都会让模型损失这部分信息,甚至让剩下那个变量的系数波动变大,模型稳定性下降。
- 正则化的收缩“干扰”:L2正则化会把所有系数往0收缩,哪怕是原本很有用的变量,系数被缩小后,对应的t统计量(p值的计算基础)也会变小,p值自然就升高了。这时候高p值不是变量没用,是正则化把它的“显著性”给掩盖了,要是随便移除,就丢了真正有价值的变量。
- 数据本身的问题:如果样本量太小,或者数据分布有偏,p值本身就特别不稳定,这时候用高p值判断变量该不该留,很容易犯错误。
三、正则化后的p值什么时候会误导人?原因是什么?
最容易踩坑的场景主要有这几个:
- 存在高度共线变量时
即使仅存在2个共线变量,正则化后的p值也可能出现“此消彼长”的情况:其中一个变量的p值变得极高,另一个却相对显著,但实际上两者的作用是绑定的。
这是因为正则化在处理共线性时,会把原本该分给两个变量的权重重新分配,导致单个变量的p值根本没法真实反映它的边际贡献——它们的价值是共同体现的,单独看p值肯定会误判。 - 使用L2正则化时
L2的均匀收缩特性,会让所有系数都往0靠,哪怕是真正有意义的变量,系数被缩小后,对应的统计显著性也会被削弱,p值升高。这时候高p值完全是正则化的“锅”,和变量本身的价值无关,要是根据p值移除,绝对会丢了有用的变量。 - 正则化强度调得太极端时
如果把正则化的λ值设得太大,所有系数都会被过度收缩到接近0,这时候几乎所有变量的p值都会很高,但这并不代表这些变量都没用,只是正则化的强度压过了变量的真实信号,p值完全不能反映变量的实际价值。
内容的提问来源于stack exchange,提问作者Narahari B M
相关产品推荐
相关产品推荐

