随机森林条件变量重要性计算:R实现过慢,有无更快Python方案?
二分类模型条件变量重要性计算的性能优化疑问
我正在开展一项确定最优二分类预测变量的项目,流程为先拟合随机森林模型,再计算条件变量重要性用于亚组分析。使用R的party包训练模型仅需数分钟,但在大数据集下计算条件变量重要性往往需要数小时甚至数天。
目前我采用的计算方法包括:
- 基于论文的
party::varimp - 基于同作者后续论文的
permimp::permimp
疑问:由于R中的实现速度过慢,是否存在更快的Python替代包?或是该算法本身无法实现更高效的计算?
补充:我发现conditional = TRUE是最影响计算速度的设置,当该参数设为TRUE时,计算速度比设为FALSE慢得多,示例代码如下:
# 使用party包的cforest: library(party) # 拟合模型 cf <- cforest(Species ~ ., data = iris, controls=cforest_unbiased(ntree=500, mtry=3)) # 获取变量重要性 varimp(cf, conditional = TRUE, nperm = 10)
内容的提问来源于stack exchange,提问作者Kate
相关产品推荐
相关产品推荐

