You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Weka中GainRatioAttributeEval输出的属性排序结果如何解读?

GainRatioAttributeEval 输出解读

你给出的属性排名结果三列从左到右含义如下:

  • 第一列:增益比得分,即GainRatioAttributeEval的核心计算结果,取值范围理论上为0~1(你看到的1.0000000000000009是浮点数运算的精度误差,实际值为1),得分越高代表该属性对类别标签(drug)的区分能力越强。
  • 第二列:属性在数据集中的索引编号,Weka中属性默认从1开始计数,你可以对照预处理概览的属性顺序验证:1=Age、2=Sex、3=BP、4=Cholesterol、5=Na_to_K,6是类别属性drug,不会出现在特征评估结果中。
  • 第三列:属性名称。

结果参考意义

该输出是按照增益比得分从高到低对特征做的优先级排序,可直接用于特征筛选:

  1. Na_to_K增益比接近满分,是对drug分类贡献最大的特征,单独就可以完成大部分样本的分类判断
  2. 特征贡献度依次为 BP > Age > Cholesterol > Sex
  3. Sex的增益比仅为0.007左右,和分类目标的相关性极低,建模时可以考虑直接移除,降低噪声干扰。

你已经掌握信息增益的计算逻辑,增益比本质是在信息增益的基础上除以了属性的固有熵,解决了信息增益天然偏向取值数量多的属性的缺陷,所以这个排序结果比单纯用信息增益得到的排序更公平,不会因为某个属性取值更多就被误判为更重要。


内容的提问来源于stack exchange,提问作者Encipher

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 14:30:02