使用WEKA的Apriori算法分析KDD Cup 1999数据集无结果求助
KDD Cup 1999数据集WEKA Apriori关联分析解决方案
一、数据格式重构要点
- 检查.arff文件结构:转标称后的属性不能把每个数值都当成独立取值,比如duration这类字段要先分箱(比如0、1-100、100+),不然属性取值爆炸,Apriori根本跑不动。还要确保所有标称值没有空格、特殊符号,class列的取值(normal/攻击类型)要统一大小写和拼写。
- 删除冗余属性:像num_outbound_cmds这种取值单一的属性直接删掉,对关联规则没意义还占资源。
- 处理缺失值:用WEKA的ReplaceMissingValues过滤器清理缺失数据,Apriori对缺失值兼容性很差。
二、内存不足问题解决
- 加WEKA堆内存:改启动脚本里的
-Xmx参数,比如改成-Xmx8g(按你机器内存来,一般设成物理内存的70%)。 - 用抽样数据:别直接跑480万条,先用Resample过滤器抽10%-20%的样本跑通流程,再逐步加量。
- 存成稀疏格式:如果数据里大量属性是默认值,保存时选"Save as sparse ARFF",能大幅减少内存占用。
三、Apriori参数调整(20条数据无结果大概率是参数错了)
- 调低最小支持度(minSupport):默认0.1对20条样本太高,改成0.05甚至0.01,保证有频繁项集生成。
- 调低最小置信度(minConfidence):默认0.9太严,小样本下改成0.5试试。
- 缩小最大项集大小(maxRuleLength):默认5,小样本设为3,降低计算复杂度。
- 勾选"carpet"选项:关闭冗余规则,加快运算速度。
四、结果验证方法
- 跑完先看结果面板里的"Number of cycles"和"Number of frequent itemsets",要是都是0,继续调minSupport和minConfidence。
- 重点看包含class属性的规则,比如
protocol_type=tcp, service=http => class=normal,lift值大于1的规则才有实际意义,结合conviction值评估规则有效性。
内容的提问来源于stack exchange,提问作者Thanos
相关产品推荐
相关产品推荐

