You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python库检测数据集各列数据是否服从正态分布

正态性校验与转换实现方案

现有代码问题

  • 重复调用zscore()计算同一列的z值,运行效率低,且全局变量x的封装性差
  • 仅依靠68-95-99.7经验法则的区间占比判断正态性,精度不足,无法作为正态性的判定依据
  • 语法存在疏漏:return语句末尾缺少闭合括号,无法正常运行

正态性检验实现

标准化区间占比仅可作为辅助校验手段,正规的正态性检验可结合统计检验与可视化判断,示例代码如下:

import pandas as pd
import numpy as np
from scipy.stats import shapiro, kstest, norm, zscore

# 正态性检验函数
def check_normality(col_data, alpha=0.05):
    # 先过滤空值
    col_data = col_data.dropna()
    # 样本量小于5000用Shapiro-Wilk检验,否则用Kolmogorov-Smirnov检验
    if len(col_data) < 5000:
        stat, p_val = shapiro(col_data)
    else:
        # KS检验需要先将数据标准化
        z_data = zscore(col_data)
        stat, p_val = kstest(z_data, 'norm')
    # p值大于alpha则认为服从正态分布
    is_normal = p_val > alpha
    # 辅助校验:经验法则区间占比偏差
    z_data = zscore(col_data)
    rate_1std = np.mean((z_data >= -1) & (z_data <= 1)) * 100
    rate_2std = np.mean((z_data >= -2) & (z_data <= 2)) * 100
    rate_3std = np.mean((z_data >= -3) & (z_data <= 3)) * 100
    return {
        "is_normal": is_normal,
        "p_value": round(p_val, 4),
        "1std_rate": round(rate_1std, 2),
        "2std_rate": round(rate_2std, 2),
        "3std_rate": round(rate_3std, 2)
    }

# 遍历数据集所有列校验
# 假设你的数据集为df
norm_check_result = {}
for col in df.select_dtypes(include=[np.number]).columns:
    norm_check_result[col] = check_normality(df[col])

非正态数据转换为正态分布的常用方法

根据数据分布特征选择对应转换方法,常用方案如下:

  • 对数变换:适合右偏分布,np.log1p(col_data)可避免数据为0时报错
  • 平方根变换:适合计数类、方差和均值成正比的偏态数据
  • Box-Cox变换:仅支持正数值的连续变量,可自动找到最优变换参数,示例代码:
    from scipy.stats import boxcox
    # 变换后得到正态分布数据和最优lambda参数
    transformed_data, lambda_param = boxcox(col_data[col_data > 0])
    
  • 反双曲正弦变换:支持包含0、负值的偏态数据,公式为np.arcsinh(col_data)

你可以遍历所有数值列,对判定为非正态的列自动尝试上述变换,再重新校验正态性,选择最优转换方案即可。

内容的提问来源于stack exchange,提问作者Lijin Durairaj

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.23 14:24:01