模型训练测试得分与数值量级的关系及线性回归异常问题咨询
回归模型MSE与数值量级、数据预处理问题解答
问题1:数值量级更大是否会导致MSE更高?
是的,目标变量的数值量级差异会直接造成MSE的巨大差距。
MSE的计算公式为 MSE = 平均((实际值 - 预测值)²),逻辑回归的目标是0/1布尔值,最大差值平方仅为1,因此MSE必然落在0-1区间。而线性回归的目标是5-6位数的resale_price,哪怕预测值与实际值仅相差几百,平方后就是几万甚至几十万,直接拉高了整体MSE的数值。
问题2:线性回归训练及测试MSE达100000左右,是否存在数据预处理问题?
这种情况大概率和数据预处理有关,但也需要结合模型适配性分析:
- 特征与目标量级不匹配:如果特征都是小范围数值(比如0-10),但目标是5-6位数,模型难以学习到合理的权重参数,容易出现大幅预测偏差,进而推高MSE。这种情况可以对目标变量做对数变换、Z-score标准化,或者对特征做缩放处理,缩小量级差距。
- 特征质量缺陷:如果特征存在大量缺失值、极端异常值,或者与目标变量
resale_price没有线性相关性,线性回归无法拟合数据规律,自然会出现高MSE。比如用和房价无关的特征建模,模型完全找不到预测逻辑,偏差会极大。 - 模型选择错误:线性回归仅适用于特征与目标存在线性关系的场景,如果实际是非线性关系(比如房价和面积的平方相关),硬套线性回归必然会出现高MSE,这时候需要换用非线性模型(如树模型、多项式回归)。
另外需要注意:线性回归属于回归任务,不应该用“准确率”这个分类任务的指标来评估,你提到的“准确率为负值”是指标误用导致的异常结果,回归任务应该用R²、MAE、MSE这类指标来衡量模型效果。
内容的提问来源于stack exchange,提问作者Wee Liang Kelven Lim
相关产品推荐
相关产品推荐

