You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Weka中不平衡数据集场景下Attribute evaluator是否适用?

核心问题解答

Attribute evaluator本身适用于不平衡数据集,你操作后效果变差,本质是属性选择阶段的评估逻辑没有适配不平衡数据的特性,具体原因和优化方案如下:

问题根因

你当前使用的Subset Evaluator默认采用整体分类准确率作为特征子集的评估标准,这类指标在不平衡数据集上天然偏向多数类:只要特征能帮助模型正确判断占比更高的负样本,就能拿到很高的准确率评分,最终选出来的特征子集完全不考虑少数正样本的识别效果,所以你筛选特征后模型更偏向负样本,True negative和True positive的比例从7:1恶化到12:1。

优化方案

  • 调整属性选择的评估指标:在Weka的Subset Evaluator设置中,将默认的整体准确率替换为对不平衡数据友好的评估指标,比如F1值、Kappa系数、少数类召回率、AUC值即可,保证特征选择阶段同时兼顾正负样本的识别效果。
  • 属性选择前先处理数据不平衡问题:使用Weka自带的采样过滤器,要么对多数类做随机欠采样,要么对少数类用SMOTE算法做过采样,拿到类别相对均衡的数据集后再做特征选择。
  • 调整Random Forest的分类参数:开启Weka随机森林中的类别权重设置,给少数类分配更高的权重,避免模型天然向多数类倾斜。
  • 更换效果评估标准:不要仅参考True negative和True positive的比例,补充看少数类的召回率、F1值、AUC-PR等指标,更全面判断模型效果。

内容的提问来源于stack exchange,提问作者Encipher

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 19:54:03