Weka中的merit评判准则具体含义及取值规则是什么?
Weka属性选择模块中Merit值的定义与判断标准
核心定义
Merit是Weka属性选择模块中,属性评估器(Attribute Evaluator)针对当前属性/属性子集输出的质量量化分,核心作用是衡量该属性/属性子集对后续建模任务的适配能力,不同评估器的计算逻辑存在差异:
- 最常用的
CfsSubsetEval(关联特征子集评估器):Merit计算公式为「属性子集与分类标签的相关性总和」除以「属性子集内部两两相关性总和的平方根」,核心逻辑是鼓励属性和标签的高关联,同时惩罚属性之间的冗余。 WrapperSubsetEval(包裹式评估器):Merit值直接等于使用当前属性子集训练指定分类器的交叉验证性能(默认是分类准确率)。InfoGainAttributeEval/GainRatioAttributeEval等单属性评估器:Merit值对应单属性的信息增益/增益率,衡量单个属性能够为分类任务提供的信息量。
优劣判断标准
Weka所有内置属性评估器的Merit值全部为越高越好,没有越低越好的场景。
属性搜索算法(比如BestFirst、GreedyStepwise)的运行逻辑就是遍历所有可能的属性组合,最终输出Merit值最高的属性子集作为最优结果。
注意:不同评估器的Merit值没有横向可比性,例如
CfsSubsetEval输出的Merit取值范围多在0~1区间,和WrapperSubsetEval输出的准确率Merit计算逻辑完全不同,仅能在同一评估器的前提下对比不同属性子集的优劣。
内容的提问来源于stack exchange,提问作者Ismael Ouarit
相关产品推荐
相关产品推荐

