逻辑回归与以其为基学习器的Bagging、Boosting集成模型得分一致问题
逻辑回归单模型与基于逻辑回归的集成模型得分完全一致的原因
出现该问题通常有以下几类原因:
- 数据集线性可分性极强,单逻辑回归模型已经可以拟合出全局最优的线性决策边界。不管是Bagging的随机采样、还是AdaBoost的样本权重调整,都无法让基学习器拟合出更优的决策边界,最终三类模型的预测结果完全一致,得分自然相同。
BaggingClassifier的采样结果与原数据集分布无显著差异。如果你的训练数据集样本分布非常均匀,你设置的bootstrap=True采样得到的50个训练子集的分布和原训练集几乎完全一致,每个子集中训练出的LogisticRegression参数和单模型参数几乎没有差别,最终集成投票的输出结果和单模型输出完全重合。AdaBoostClassifier的特性与线性基学习器不匹配。AdaBoost的核心是通过迭代提升错分样本的权重,让后续基学习器重点关注难分样本,该机制对样本权重敏感度高的弱学习器(比如决策树桩)效果明显,但逻辑回归属于线性模型,对样本权重调整的敏感度极低,权重变化很难影响最终拟合出的决策边界;如果单逻辑回归在训练集上的误差已经很低,你设置的learning_rate=1、n_estimators=50的参数配置下,AdaBoost后续迭代根本无法有效调整模型方向,最终集成结果和单模型完全一致。- 测试集的样本特性导致。如果测试集中大部分样本都属于易分样本,三类模型都能正确预测,少数难分样本三类模型全部预测错误,也会出现最终准确率完全一致的情况。
内容的提问来源于stack exchange,提问作者Osvaldo Figo
相关产品推荐
相关产品推荐

