如何将经RandomizedSearchCV调优的Random Forest多分类器应用于无标签数据集?
无标签数据集的类别预测步骤
- 提取训练好的最优模型
你通过RandomizedSearchCV得到的实例(比如命名为random_search)中,best_estimator_属性就是用最优参数在训练集上完成训练的Random Forest分类器,直接用这个模型即可,无需重新训练。 - 预处理无标签数据
确保无标签数据的特征与训练数据完全匹配:包括特征数量、顺序、类型,且使用和训练阶段一致的预处理逻辑(比如用训练时拟合的标准化器、缺失值填充规则处理无标签数据,不能重新拟合预处理工具)。 - 执行预测
调用模型的predict()方法生成类别标签,示例代码:# 假设random_search是你的RandomizedSearchCV实例 best_rf_model = random_search.best_estimator_ # 提取无标签数据的特征矩阵(需与训练时特征维度一致) X_unlabeled = 你的无标签特征数据 # 比如pd.read_csv("unlabeled_data.csv").values # 生成预测标签 predicted_labels = best_rf_model.predict(X_unlabeled) - (可选)获取预测概率
如果需要每个样本属于各类别的概率值,使用predict_proba()方法:class_probabilities = best_rf_model.predict_proba(X_unlabeled) - 保存预测结果
将预测标签与原无标签数据合并后保存,示例:import pandas as pd unlabeled_df = pd.read_csv("unlabeled_data.csv") unlabeled_df["predicted_label"] = predicted_labels unlabeled_df.to_csv("labeled_result.csv", index=False)
内容的提问来源于stack exchange,提问作者user20633102
相关产品推荐
相关产品推荐

