混合特征下基于相关性的特征筛选:回归与分类任务相关性计算咨询
相关性计算方法选择建议
一、回归任务场景(目标为连续变量)
1. 连续特征与独热编码分类特征之间
独热编码后的特征属于二元(0/1)变量,这种场景下直接使用Pearson相关系数即可——因为当其中一个变量为二元时,Pearson相关的计算结果等价于专门针对连续-二元变量设计的点二列相关系数,两者数值完全一致。如果需要更明确匹配场景,也可以调用scipy.stats.pointbiserialr计算点二列相关。
2. 独热编码分类特征与连续目标变量之间
同样适用点二列相关系数或Pearson相关系数。独热特征是二元变量,目标为连续变量,这两种方法都能准确衡量两者的关联程度,完全适配你“筛选与目标相关性更低的高相关特征”的需求。
二、分类任务场景(目标为分类变量)
1. 独热编码分类特征与分类目标变量之间
- 若为二分类目标+二分类独热特征:可使用Phi系数(Pearson相关的特例),或卡方检验判断两者是否独立;
- 若为多分类目标:优先用卡方检验(验证特征与目标的独立性),或互信息(Mutual Information)(衡量两者的信息关联程度,无分布假设限制)。实现上可分别调用
scipy.stats.chi2_contingency和sklearn.feature_selection.mutual_info_classif。
2. 连续特征与分类目标变量之间
- 若为二分类目标:用点二列相关系数;
- 若为多分类目标:用ANOVA方差分析(判断连续变量在不同类别下的均值是否存在显著差异,以此衡量关联性),或互信息。实现上可调用
scipy.stats.f_oneway执行ANOVA,互信息仍用mutual_info_classif。
补充:特征筛选流程适配
在你的回归任务特征去重流程中,计算特征间相关性时,连续-独热特征对直接用Pearson相关完全可行;计算特征与目标的相关性时,独热特征用点二列/Pearson、连续特征用Pearson,统一标准后即可按“移除与目标相关性更低的高相关特征”的逻辑执行。
内容的提问来源于stack exchange,提问作者Mohammad
相关产品推荐
相关产品推荐

