应用LDA降维后,如何确定选中与未选中的特征维度?
LDA降维与特征选择的误区说明
首先要明确:LDA并不是直接“选中”或“剔除”原始特征,它的降维原理是通过最大化类间离散度与类内离散度的比值,生成原始特征的线性组合作为新的低维特征。对于Iris数据集的4个原始特征(花萼长度、花萼宽度、花瓣长度、花瓣宽度),降维到2维后得到的是两个全新特征,每个新特征都是4个原特征的加权求和结果。
如何分析原特征对LDA新特征的贡献
如果使用sklearn的LinearDiscriminantAnalysis工具,可以通过访问模型的.components_属性,查看每个新特征对应的原特征权重。权重的绝对值越大,说明对应的原特征对该LDA新特征的贡献越高。
举个实际运行后的典型结果(不同环境下数值可能略有浮动,但趋势一致):
- 第一个LDA新特征的权重可能为:[0.829, 0.024, 0.560, 0.046]
- 第二个LDA新特征的权重可能为:[0.024, 0.999, 0.046, 0.037]
从权重能看出:
- 第一个新特征主要由花萼长度和花瓣长度贡献
- 第二个新特征主要由花萼宽度贡献
- 花瓣宽度在两个新特征中的权重都很低,贡献最小
但这并不代表LDA“选中”了前三个特征、“剔除”了花瓣宽度——所有原特征都参与了新特征的构建,只是贡献度存在差异。
总结
LDA没有严格意义上的“选中/未选中特征”,它是通过线性组合的方式将高维特征映射到低维空间。如果要评估原特征的重要性,可以通过LDA模型输出的权重来判断各原特征对新特征的贡献程度。
内容的提问来源于stack exchange,提问作者Yash
相关产品推荐
相关产品推荐

