如何为数据框添加虚拟水平以满足caret包confusionMatrix()的要求?
解决caret中confusionMatrix()的水平匹配问题
这个问题我之前也踩过坑——caret包的confusionMatrix()确实要求真实标签(测试集的Class列)和预测结果的因子水平完全一致,哪怕某个水平在测试集里出现次数为0也得明确列出来。针对你提供的示例数据,这里有两种简单可行的方法:
方法1:给测试集的Class列补充缺失的水平
先把测试集的Class转为因子,再手动添加预测结果里存在但测试集没有的水平:
# 加载caret包 library(caret) # 你的示例数据 test <- data.frame(Feature=c("1200","1000","1000"), Class = c("a","b","b")) predicted_model <- c("a","a","b","c") # 将测试集的Class转为因子 test$Class <- factor(test$Class) # 补充预测结果中存在的水平(这里是"c") test$Class <- factor(test$Class, levels = union(levels(test$Class), predicted_model))
方法2:统一转换两者的因子水平
更稳妥的方式是先收集所有出现过的标签,再把真实标签和预测结果都转成包含所有水平的因子:
# 收集所有出现过的标签(测试集+预测结果) all_levels <- unique(c(test$Class, predicted_model)) # 统一转换为因子,确保水平完全匹配 test$Class <- factor(test$Class, levels = all_levels) predicted_model <- factor(predicted_model, levels = all_levels)
验证效果
现在再运行confusionMatrix()就不会报错了:
# 注意:confusionMatrix的第一个参数是预测值,第二个是真实值 confusionMatrix(predicted_model, test$Class)
这样处理后,即使测试集里没有"c"类的样本,函数也会在混淆矩阵里为这个类别留出位置,正常计算各项指标。
内容的提问来源于stack exchange,提问作者Arrebimbomalho
相关产品推荐
相关产品推荐

