You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

机器学习模型欠拟合与过拟合分析:两类回归器性能疑问

模型误差疑问解答

1. RandomForestRegressor训练MSE高、测试MSE低是否属于欠拟合?

首先明确:欠拟合的典型表现是训练集和测试集的MSE都偏高,模型连训练数据的基本规律都没学会。你遇到的这种情况不符合常规欠拟合特征,先优先排查代码问题——是不是计算时搞反了训练集和测试集的输入?比如把测试数据拿去算训练集预测、训练数据拿去算测试集预测?
如果代码没问题,那大概率是数据的锅:要么训练集本身噪声多、异常值扎堆,要么训练集和测试集的数据分布差得远(比如训练集是复杂场景数据,测试集是简单场景数据)。这种时候模型在混乱的训练集上难拟合,但在简单的测试集上反而表现好,不能直接判定为欠拟合,得先检查数据划分和数据质量。

2. XGBRegressor训练误差低、测试误差高是否属于过拟合?

这就是标准的过拟合:模型在训练集上学得太“细”,把训练数据里的噪声、个别样本的特殊规律当成了通用模式,到了从未见过的测试集上就原形毕露了。
可以从这几个方向调整:

  • 调参:加正则化(比如调大reg_alpha、reg_lambda),降低树的最大深度(max_depth),减少每棵树用的样本比例(subsample),调小学习率(learning_rate)同时适当增加树的数量;
  • 数据:增加训练样本量,或者对现有训练数据做数据增强;
  • 特征:删掉冗余、噪声大的特征,做特征降维。

内容的提问来源于stack exchange,提问作者adedokun44

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 02:35:23