关于集成学习(同构vs异构集成)的理解正确性确认及概念澄清
你的理解大方向是对的,但咱们可以把这两个集成学习概念的核心边界再捋得更清晰一点,避免混淆:
同构集成(Homogeneous Ensembles)
- 核心特征:所有基分类器都是同一种模型类型(比如全是决策树、全是线性SVM)。
- 基分类器的差异来源:通常是训练数据的不同子集(比如随机森林用bootstrap采样生成的不同训练集)、输入特征的不同子集(随机森林每次节点分裂时随机选特征),或者是模型初始化的随机参数差异。
- 典型例子:
Random Forest(一堆决策树的集合)、AdaBoost(默认用同类型弱分类器,比如决策树桩)。
异构集成(Heterogeneous Ensembles)
- 核心特征:基分类器是不同类型的模型(比如同时用决策树、逻辑回归、神经网络、KNN)。
- 训练数据:这类集成通常会在相同的完整训练数据集上训练各个基模型,目的是利用不同模型的优势互补——毕竟不同模型对数据的拟合方式不同,能捕捉到不同的模式。
- 典型例子:
Stacking(堆叠集成,先用多种不同基模型生成预测结果,再用一个元模型整合这些结果)、简单的“投票法”(比如让逻辑回归、SVM和决策树一起投票做预测)。
补充一点:你之前提到的“同构基于不同数据、异构基于相同数据”是常见情况,但不是绝对的——比如同构集成也可能用相同数据,靠调整模型参数制造差异;但模型类型是否一致才是区分两者的核心标准,这点要抓住哦。
内容的提问来源于stack exchange,提问作者Zoya
相关产品推荐
相关产品推荐

