You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

决策树Information gain属性偏向性及Information gain ratio偏向原理咨询

决策树信息增益与信息增益率的偏向性原理说明

1 信息增益的偏向性原因与作用机制

信息增益是决策树最早使用的划分选择指标,核心衡量属性对数据集不确定性的降低程度,其偏向多取值属性的机制如下:

  • 计算逻辑:信息增益 = 划分前数据集的熵 - 按当前属性划分后所有子数据集的加权平均熵,数值越大代表该属性对分类的提升效果越好
  • 偏向性来源:当属性的可取值数量越多,对数据集的拆分粒度就越细,每个子样本集的样本量越少,天然更容易出现子集合类别纯度更高的情况,对应计算得到的信息增益值也就越大
  • 负面影响:极端场景下类似用户ID、订单号这类唯一标识属性会被优先选中,这类属性拟合的是训练集的随机独有特征,完全没有泛化能力,会直接导致模型过拟合

2 信息增益率的偏向性背景与原理

信息增益率是为了修正信息增益的固有缺陷提出的优化指标,它本身的偏向性逻辑如下:

  • 设计初衷:为了抑制信息增益过度偏向多取值属性的问题,指标引入了属性固有值作为校正项
  • 计算逻辑:信息增益率 = 信息增益 / 属性固有值,其中属性固有值是衡量属性自身取值分散程度的熵值,属性取值越多、取值分布越均匀,固有值的计算结果就越大
  • 偏向性原理:多取值属性的固有值更高,会直接拉低最终的信息增益率计算结果,因此模型在选择划分属性时,天然会优先选择取值数量更少的属性,不会优先考虑多取值属性
  • 附带缺陷:这种偏向同样存在过拟合风险:如果模型过度优先选择取值少的属性,可能会选中区分度极低的弱相关属性,导致划分后的子集纯度提升有限,无法学到数据的真实分布规律,泛化能力反而下降

内容的提问来源于stack exchange,提问作者M.Sworna Vidhya

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 13:39:03