Weka REPTree决策树测试输出与训练模型逻辑不一致问题
Weka REPTree模型分类异常问题
训练生成的模型结构
我用Weka中的REPTree分类器训练了一个决策树模型,生成的模型结构如下:
Has Pool? = FALSE | Spike Count < 4.5 | | Early/Pump Demand < 0.94 : 0 (265/3) [128/1] | | Early/Pump Demand >= 0.94 | | | 1-hour delta/day < 0.6 : 0 (26/0) [15/0] | | | 1-hour delta/day >= 0.6 | | | | Daily Usage < 40.29 : 2 (17/0) [9/0] | | | | Daily Usage >= 40.29 : 0 (7/3) [3/1] | Spike Count >= 4.5 | | Early/Pump Demand < 0.66 : 0 (10/0) [7/1] | | Early/Pump Demand >= 0.66 : 2 (108/2) [55/2] Has Pool? = TRUE : 3 (82/0) [41/0]
测试集评估结果异常
在独立测试集上重新评估该模型时,没有任何测试实例被分类到'3'类别,尽管测试集中确实存在Has Pool? == True的实例。混淆矩阵如下:
a b c <-- classified as 2497 73 0 | a = 0 0 0 0 | b = 2 0 0 0 | c = 3
类别c本应有85个实例。我在Excel中手动对测试集应用决策树逻辑,得到的各类别实例数量与模型输出不同。令我困惑的是,模型树的分支明确规定Has Pool? == True的实例应被分类为'3',为何实际输出却不符?
内容的提问来源于stack exchange,提问作者PowerSystemsDev
相关产品推荐
相关产品推荐

