YData Profiling仅显示‘auto’关联表:求关联类型及全关联获取方法
YData Profiling 中「auto」关联表的问题解答
「auto」关联表的本质
你的数据集有20万条样本,属于较大规模,YData Profiling会自动启动性能优化:默认只计算并展示变量间相关性排名靠前的子集,这个子集就标记为「auto」。它不是某一种特定的关联算法,而是工具为了避免内存过载、缩短运行时间,自动筛选出的高相关性关联集合。
获取全量关联的配置方法
要生成所有变量的关联表,需要在初始化ProfileReport时手动配置相关性参数,关闭自动筛选:
from ydata_profiling import ProfileReport profile = ProfileReport( df, title="Pandas Profiling Report", correlations={ # 开启需要计算的关联类型(按需选择,不用全选) "pearson": {"calculate": True}, "spearman": {"calculate": True}, "kendall": {"calculate": True}, "phi_k": {"calculate": True}, "cramers": {"calculate": True}, # 关闭自动筛选模式 "auto": {"calculate": False} } ) profile.to_widgets()
注意:计算20万条样本的全量关联会占用大量内存和计算时间,建议根据业务需求只保留需要的关联类型(比如仅计算pearson和spearman),减少资源消耗。
内容的提问来源于stack exchange,提问作者kehlou
相关产品推荐
相关产品推荐

