You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于Decision Tree等回归模型预测差异与性能的技术咨询

决策树与其他回归模型的异常表现解析

1. 为何决策树(DT)预测值几乎与实际收入一致,其他回归器表现正常?

  • 核心原因是决策树默认无剪枝,在小数据集上发生了严重过拟合。决策树的分裂逻辑会持续划分节点,直到每个叶子节点只包含单个样本(或满足极低的默认最小样本数阈值),此时每个叶子节点直接输出对应样本的真实收入值,导致预测值和实际值几乎完全重合。
  • 数据量过小、特征数量少会加剧这种情况:小数据集下,模型很容易记住所有样本特征与标签的映射;特征少则每个特征的分裂能快速区分样本,进一步推动过拟合。

2. 为何DT会产生不合理结果,但随机森林(RF)不会?

  • 随机森林是集成学习中的Bagging算法,通过两个核心机制避免单棵树的过拟合:
    • 自助采样(Bootstrap):每个基决策树只使用训练集的一个随机子集,样本多样性降低了单棵树的过拟合程度;
    • 特征随机选择:每个节点分裂时只考虑随机选取的部分特征,避免单棵树依赖某几个强特征过度拟合。
  • 最终RF通过多棵树的预测结果平均(回归任务),抵消了单棵树的极端偏差,因此不会出现DT那种完全拟合训练数据的不合理情况。

3. DT的R²低于LR、MSE高于LR,但预测范围更窄,这是如何发生的?

  • 这里的指标(R²、MSE)应该是针对测试集的结果:DT在训练集上完全拟合,但泛化能力极差,面对未见过的测试样本时,只能基于训练集中相似的小样本子集输出均值,预测误差大,因此R²更低、MSE更高。
  • 预测范围窄的原因:回归树的预测值只能是训练集标签中存在的取值(或叶子节点内样本的均值),无法像线性回归(LR)那样通过线性关系进行外推(比如预测超出训练集年龄/工作年限范围的样本收入)。LR的预测值是基于特征的线性组合,范围可以覆盖训练集之外的区间,对比之下DT的预测范围就显得更窄。

内容的提问来源于stack exchange,提问作者TotalGadha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 03:52:11