高维场景(n≪p)下岭回归是否无用?OLS为何不会过拟合?
这是个非常戳中高维统计认知盲区的好问题,很多人会默认高维下OLS必过拟合、岭回归没用,但其实这里的逻辑和低维场景有不小的差异,咱们慢慢拆解:
先搞懂高维下的「最小范数OLS估计量」
当$n \ll p$时,常规OLS的解不唯一(因为$X^\top X$是奇异矩阵,有无穷多组$\hat\beta$满足$X\hat\beta = y$),所以我们说的OLS是最小范数OLS估计量,完整公式是:
$$\hat\beta_\text{OLS} = X^\top (XX\top){-1}y$$
它是所有能完美拟合训练数据的解里,系数向量范数$|\hat\beta|_2$最小的那个。
那为什么它不会出现低维场景里的「过拟合」?这里要纠正一个误区:低维下的过拟合是指模型在训练集上表现极好,但对新数据预测拉胯;但高维下的最小范数OLS,虽然完美拟合了训练数据(训练误差为0),但它的系数范数被严格限制到最小——这反而避免了那些大范数解带来的极端波动。不过这不代表它的泛化能力就强,只是它的“问题”不再是传统意义上的过拟合,而是可能依然受噪声影响,泛化误差不够理想。
高维下岭回归绝非毫无用处
岭回归的核心是通过正则项$\lambda I$在「拟合误差」和「系数范数」之间做权衡,它的解:
$$\hat\beta = (X^\top X + \lambda I){-1}X\top y$$
在高维场景下依然有不可替代的价值:
- 方差压缩:最小范数OLS虽然范数小,但系数的方差可能依然很大;岭回归通过引入$\lambda$,能有效降低系数的方差,哪怕牺牲一点点训练拟合度,最终的泛化误差反而可能更低。
- 噪声过滤:如果真实的系数向量$\beta$本身是低范数的(比如稀疏或大部分系数接近0),岭回归的正则化能进一步压缩噪声带来的无效系数,让模型更贴近真实数据生成过程。
- 交叉验证的作用:你提到的10折交叉验证依然有效——它能帮我们找到最优的$\lambda$值,精准平衡偏差和方差,让岭回归的泛化性能超过最小范数OLS。
最后再澄清一个关键认知
高维下判断模型好坏,绝对不能只看训练误差(毕竟最小范数OLS的训练误差是0),核心要看泛化误差。岭回归的价值就在于,它能在高维的“解空间”里,找到一个比最小范数OLS更优的平衡点,让模型在新数据上的表现更好。
内容的提问来源于stack exchange,提问作者amoeba

