Weka中GainRatioAttributeEval输出的属性排序结果如何解读?
GainRatioAttributeEval 输出解读
你给出的属性排名结果三列从左到右含义如下:
- 第一列:增益比得分,即
GainRatioAttributeEval的核心计算结果,取值范围理论上为0~1(你看到的1.0000000000000009是浮点数运算的精度误差,实际值为1),得分越高代表该属性对类别标签(drug)的区分能力越强。 - 第二列:属性在数据集中的索引编号,Weka中属性默认从1开始计数,你可以对照预处理概览的属性顺序验证:1=Age、2=Sex、3=BP、4=Cholesterol、5=Na_to_K,6是类别属性drug,不会出现在特征评估结果中。
- 第三列:属性名称。
结果参考意义
该输出是按照增益比得分从高到低对特征做的优先级排序,可直接用于特征筛选:
Na_to_K增益比接近满分,是对drug分类贡献最大的特征,单独就可以完成大部分样本的分类判断- 特征贡献度依次为 BP > Age > Cholesterol > Sex
- Sex的增益比仅为0.007左右,和分类目标的相关性极低,建模时可以考虑直接移除,降低噪声干扰。
你已经掌握信息增益的计算逻辑,增益比本质是在信息增益的基础上除以了属性的固有熵,解决了信息增益天然偏向取值数量多的属性的缺陷,所以这个排序结果比单纯用信息增益得到的排序更公平,不会因为某个属性取值更多就被误判为更重要。
内容的提问来源于stack exchange,提问作者Encipher
相关产品推荐
相关产品推荐

