如何使用Python库检测数据集各列数据是否服从正态分布
正态性校验与转换实现方案
现有代码问题
- 重复调用
zscore()计算同一列的z值,运行效率低,且全局变量x的封装性差 - 仅依靠68-95-99.7经验法则的区间占比判断正态性,精度不足,无法作为正态性的判定依据
- 语法存在疏漏:return语句末尾缺少闭合括号,无法正常运行
正态性检验实现
标准化区间占比仅可作为辅助校验手段,正规的正态性检验可结合统计检验与可视化判断,示例代码如下:
import pandas as pd import numpy as np from scipy.stats import shapiro, kstest, norm, zscore # 正态性检验函数 def check_normality(col_data, alpha=0.05): # 先过滤空值 col_data = col_data.dropna() # 样本量小于5000用Shapiro-Wilk检验,否则用Kolmogorov-Smirnov检验 if len(col_data) < 5000: stat, p_val = shapiro(col_data) else: # KS检验需要先将数据标准化 z_data = zscore(col_data) stat, p_val = kstest(z_data, 'norm') # p值大于alpha则认为服从正态分布 is_normal = p_val > alpha # 辅助校验:经验法则区间占比偏差 z_data = zscore(col_data) rate_1std = np.mean((z_data >= -1) & (z_data <= 1)) * 100 rate_2std = np.mean((z_data >= -2) & (z_data <= 2)) * 100 rate_3std = np.mean((z_data >= -3) & (z_data <= 3)) * 100 return { "is_normal": is_normal, "p_value": round(p_val, 4), "1std_rate": round(rate_1std, 2), "2std_rate": round(rate_2std, 2), "3std_rate": round(rate_3std, 2) } # 遍历数据集所有列校验 # 假设你的数据集为df norm_check_result = {} for col in df.select_dtypes(include=[np.number]).columns: norm_check_result[col] = check_normality(df[col])
非正态数据转换为正态分布的常用方法
根据数据分布特征选择对应转换方法,常用方案如下:
- 对数变换:适合右偏分布,
np.log1p(col_data)可避免数据为0时报错 - 平方根变换:适合计数类、方差和均值成正比的偏态数据
- Box-Cox变换:仅支持正数值的连续变量,可自动找到最优变换参数,示例代码:
from scipy.stats import boxcox # 变换后得到正态分布数据和最优lambda参数 transformed_data, lambda_param = boxcox(col_data[col_data > 0]) - 反双曲正弦变换:支持包含0、负值的偏态数据,公式为
np.arcsinh(col_data)
你可以遍历所有数值列,对判定为非正态的列自动尝试上述变换,再重新校验正态性,选择最优转换方案即可。
内容的提问来源于stack exchange,提问作者Lijin Durairaj
相关产品推荐
相关产品推荐

