如何使用WEKA 3.8.6生成的模型进行新数据预测及评估
WEKA 3.8.6 模型预测与评估操作指南
一、用自有输入数据开展预测
数据格式校验
- 确保自有数据与训练模型时的数据集格式完全匹配:属性数量、属性类型(数值/标称)、属性顺序必须一致;若自有数据包含真实污染水平标签,需放在最后一列(与训练集的Class列位置一致)。
- 将数据保存为WEKA支持的格式(如ARFF、CSV),若为CSV需确保表头与训练集属性名一致。
加载模型与测试数据
- 打开WEKA Explorer,切换到
Preprocess标签,点击Open file加载你的自有输入数据;检查数据无误后,将待预测的污染水平列设置为Class(选中目标属性,点击Set class)。 - 切换到
Classify标签,点击Load model按钮,选择你已保存的IBK/Additive Regression/Random Tree模型文件(.model格式)。
- 打开WEKA Explorer,切换到
执行预测
- 在
Test options区域选择Supplied test set,点击Set按钮选中已加载的自有数据。 - 点击
Classify按钮,等待模型运行完成。
- 在
导出预测结果
- 在
Result list中选中本次预测结果,右键选择Save predictions,可将结果保存为CSV或ARFF文件,文件中包含每条数据的ID、真实值(若有)、预测值及置信度(分类模型)。
- 在
二、模型评估与结果获取
1. 训练阶段的模型评估
- 若需在训练集或交叉验证上评估模型,在
Classify标签的Test options中选择:Cross-validation:默认10折交叉验证,适合评估模型泛化能力;Use training set:在训练集上评估,适合快速查看模型拟合效果。
- 运行后,在右侧
Output窗口可查看详细评估指标:- 回归模型(如Additive Regression):重点关注MAE(平均绝对误差)、RMSE(均方根误差)、R²(决定系数);
- 分类/近邻模型(如IBK、Random Tree,若污染水平为分类变量):重点关注准确率、混淆矩阵、召回率、F1值。
2. 自有数据上的模型评估
- 若自有数据包含真实污染水平标签,执行预测后,
Output窗口会自动生成该数据集上的评估指标,同时可右键结果选择Visualize classifier errors,通过散点图直观查看预测值与真实值的偏差。
3. 多模型对比
- 在
Result list中同时保留三个模型的运行结果,右键选择Compare classifier performance,WEKA会生成对比表格,清晰展示不同模型在各项评估指标上的差异,帮助你选择最优模型。
注意事项
- 若自有数据存在缺失值,需先在
Preprocess标签使用Filters(如ReplaceMissingValues)处理后再进行预测; - 确保模型加载时的Class属性与测试数据的Class属性完全匹配,否则会报错。
内容的提问来源于stack exchange,提问作者shahin rasooli
相关产品推荐
相关产品推荐

