使用sklearn做PCA降维后输出结果中各行正负值的含义是什么
样本主成分得分正负值的含义说明
你通过sklearn的PCA降维后得到的每行样本对应PC1、PC2、PC3的数值,本质是样本在对应主成分轴上的投影坐标,也叫主成分得分,正负值的具体含义如下:
- 正负本身没有固定的好坏属性,是相对所有样本在该主成分上的得分分布而言的,代表样本落在主成分轴的正方向还是负方向,所有样本在单个主成分上的得分均值为0(sklearn做PCA默认会先对原始特征做中心化处理)
- 正负对应的业务含义需要结合主成分的载荷矩阵判断:如果某个主成分的载荷中,某几个特征的载荷为显著正值,说明该主成分正方向对应这几个特征的高取值特征组合,那么该主成分得分为正的样本,就更符合这个高取值特征组合,得分为负的样本则符合相反的低取值特征组合
- 举个实际场景的例子:假设你处理的是用户行为数据集,PC1的载荷里「月消费额」「周活跃天数」两个特征的载荷为0.8和0.7(显著正值),那么PC1得分为正的样本就是高消费高活跃的用户,得分为负的就是低消费低活跃的用户
- 数值的绝对值大小代表样本和该主成分对应的特征模式的匹配程度:绝对值越大,说明样本在该主成分捕获的变异模式上的特征越突出
内容的提问来源于stack exchange,提问作者Fitriani Nasir
相关产品推荐
相关产品推荐

