线性最小二乘模型为直线已是最简,为何仍需正则化?
首先澄清一个常见认知:普通的一元线性模型(y = wx + b)因为只有2个可训练参数,在常规规模的数据集上几乎不会出现过拟合,但在以下几种特殊场景下,过拟合确实会发生,这也是正则化存在的意义:
1. 训练数据集规模极小
当你的训练数据只有寥寥几个点(比如2个点)时,直线可以完美穿过所有点,但这时候模型拟合的可能只是这几个点的随机噪声,而非数据背后的真实趋势。举个例子:假设真实规律是y=x,但你采集的两个点因为测量误差变成了(1,1.5)和(2,2.5),拟合出的直线是y=x+0.5,这个模型在训练集上误差为0,但对新的真实数据(比如(3,3))预测误差很大,这就是典型的过拟合。
2. "线性模型"实则是高维特征空间的线性拟合
很多时候我们说的"线性模型",指的是参数线性的模型,而非输入特征线性的模型。比如你把原始特征x映射到高维特征(如x²、x³、sin(x)等),然后用线性模型拟合:y = w0 + w1x + w2x² + ... + wnx^n。这时候模型在原始空间表现为曲线,但参数是线性的,属于广义线性模型。随着高维特征的增加,模型参数数量剧增,很容易拟合训练数据中的噪声,导致过拟合。
3. 数据存在严重噪声或异常值
最小二乘的损失函数是平方误差,极端异常值会被赋予极高的权重,迫使模型调整参数去拟合这些异常点。比如大部分数据点都分布在y=x附近,但有一个点是(1, 100),最小二乘拟合出的直线会被这个点大幅拉偏,最终模型在训练集上误差很小,但对正常数据的预测能力极差,这也属于过拟合(拟合了噪声而非真实规律)。
为什么需要正则化?
正则化(比如L2正则化,也就是岭回归)通过在损失函数中加入参数的范数惩罚项,约束参数的大小,核心作用是:
- 限制参数过度调整,避免模型为了拟合噪声/异常值出现极端大的参数;
- 对高维映射的线性模型,压制高次项或冗余特征的参数,让模型偏向更简单的规律;
- 本质是给模型加入"先验假设":真实模型的参数应该是相对简洁的,从而提升模型的泛化能力,让它在未见过的数据上表现更好。
内容的提问来源于stack exchange,提问作者user27665

