决策树Information gain属性偏向性及Information gain ratio偏向原理咨询
决策树信息增益与信息增益率的偏向性原理说明
1 信息增益的偏向性原因与作用机制
信息增益是决策树最早使用的划分选择指标,核心衡量属性对数据集不确定性的降低程度,其偏向多取值属性的机制如下:
- 计算逻辑:信息增益 = 划分前数据集的熵 - 按当前属性划分后所有子数据集的加权平均熵,数值越大代表该属性对分类的提升效果越好
- 偏向性来源:当属性的可取值数量越多,对数据集的拆分粒度就越细,每个子样本集的样本量越少,天然更容易出现子集合类别纯度更高的情况,对应计算得到的信息增益值也就越大
- 负面影响:极端场景下类似用户ID、订单号这类唯一标识属性会被优先选中,这类属性拟合的是训练集的随机独有特征,完全没有泛化能力,会直接导致模型过拟合
2 信息增益率的偏向性背景与原理
信息增益率是为了修正信息增益的固有缺陷提出的优化指标,它本身的偏向性逻辑如下:
- 设计初衷:为了抑制信息增益过度偏向多取值属性的问题,指标引入了属性固有值作为校正项
- 计算逻辑:
信息增益率 = 信息增益 / 属性固有值,其中属性固有值是衡量属性自身取值分散程度的熵值,属性取值越多、取值分布越均匀,固有值的计算结果就越大 - 偏向性原理:多取值属性的固有值更高,会直接拉低最终的信息增益率计算结果,因此模型在选择划分属性时,天然会优先选择取值数量更少的属性,不会优先考虑多取值属性
- 附带缺陷:这种偏向同样存在过拟合风险:如果模型过度优先选择取值少的属性,可能会选中区分度极低的弱相关属性,导致划分后的子集纯度提升有限,无法学到数据的真实分布规律,泛化能力反而下降
内容的提问来源于stack exchange,提问作者M.Sworna Vidhya
相关产品推荐
相关产品推荐

