如何获取DataFrame中sales变量与其余变量的有序相关性值
获取因变量与其他变量的有序相关性值
针对你的场景(90个变量,目标变量为sales),不需要计算全量变量的相关矩阵后再筛选,直接针对sales列计算相关性更高效,步骤如下:
- 计算
sales与所有变量的相关性并取绝对值:
corr_sales = df_train.corr()['sales'].abs()
- 移除
sales与自身的相关性(值为1,无参考意义):
corr_sales = corr_sales.drop('sales')
- 对相关性值进行排序(默认升序,若需要降序可添加
ascending=False参数):
sorted_corr = corr_sales.sort_values(ascending=False)
- 输出结果:
print(sorted_corr)
也可以把代码合并成更简洁的一行:
print(df_train.corr()['sales'].abs().drop('sales').sort_values(ascending=False))
这样得到的结果就是sales与其余89个变量的相关性值,按从高到低(或从低到高)的顺序排列,更适配你当前的数据集规模。
内容的提问来源于stack exchange,提问作者PassaroBagante
相关产品推荐
相关产品推荐

