如何解读WEKA的J48分类器结果?分析酒店预订取消关联国家
如何通过WEKA分析酒店预订取消频次最高的关联国家
一、解读已生成的J48分类树结果
J48生成的决策树以文本形式输出,核心看两点:
- 树分支与叶子节点:找到所有指向
is_cancelled=yes的分支,对应的country_origin值就是和取消行为关联的国家。比如输出片段:country_origin=ESP
| is_cancelled=yes (420/35)
这里的420是该分支的总样本数,35是错误分类数,说明西班牙用户中绝大多数(约91.6%)选择了取消预订。 - 置信度与支持度:叶子节点括号里的第一个数是分支样本量(支持度),第二个是错误分类数。支持度高且错误分类少的国家,就是取消频次最高的目标。
- 额外看输出末尾的混淆矩阵:能看到整体取消/未取消的样本分布,结合树结构里的分支样本数,可对应到具体国家的取消规模。
二、更高效的直接分析方法(无需分类树)
用J48分类属于绕路,直接用WEKA的关联规则或统计功能更精准:
方法1:Apriori关联规则
- 切换到WEKA Explorer的Associate标签页
- 选择Apriori算法,点击参数设置按钮:
- 设置
lowerBoundMinSupport为0.05(可根据数据量调整,确保覆盖足够多国家) - 设置
metricType为confidence,minMetric为0.5(仅保留取消比例≥50%的规则) - 在
targetItems里输入is_cancelled=yes(仅生成指向取消的规则)
- 设置
- 运行后,结果里类似
country_origin=ITA => is_cancelled=yes (support: 0.15, confidence: 0.82)的规则,说明意大利用户取消占比82%,且这类样本占总数据的15%,属于高取消频次的国家。
方法2:直接统计各国家取消占比
- 在Preprocess标签页,选中
country_origin列 - 点击右下角的Visualize all,在弹出窗口中选择
is_cancelled作为颜色区分维度,可直观看到哪个国家的取消样本占比最大 - 或者点击Edit按钮打开数据集编辑器,按
country_origin分组,手动统计每组中is_cancelled=yes的数量和占比,结果更直接准确
内容的提问来源于stack exchange,提问作者MrJoe
相关产品推荐
相关产品推荐

