You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

能否将scipy.stats.normaltest应用于整个DataFrame?数据正态性检验咨询

用scipy.stats.normaltest检验DataFrame正态性的常见问题解答

嘿,我来帮你理清这个问题:

1. 能不能直接将scipy.stats.normaltest应用于整个DataFrame?

完全可以! 不过要注意它的默认行为:当你把DataFrame传入normaltest时,它会自动对每一列(即每个变量)单独执行单变量正态性检验,返回的结果是每列对应的统计量和p值数组。

举个实际的代码例子:

import pandas as pd
import numpy as np
from scipy.stats import normaltest

# 生成模拟数据:两列正态分布,一列非正态
np.random.seed(42)
df = pd.DataFrame({
    'normal_data_1': np.random.normal(0, 1, 1000),
    'normal_data_2': np.random.normal(10, 3, 1000),
    'non_normal_data': np.random.exponential(1, 1000)
})

# 直接传入整个DataFrame
test_stats, p_values = normaltest(df)

# 输出结果
print("各列统计量:", test_stats)
print("各列p值:", p_values)

运行后你会看到,前两列的p值远大于0.05(无法拒绝正态假设),第三列的p值接近0(拒绝正态假设),完全符合我们的模拟数据。

如果想要更清晰的结构化结果,可以用apply方法:

result_df = df.apply(normaltest, axis=0).T
result_df.columns = ['statistic', 'p_value']
print(result_df)

这样会返回一个以原DataFrame列名为索引的结果表,可读性更强。


2. 若你的需求不是逐列检验,次优方法是什么?

如果你的场景不是检验单个变量的正态性,而是有其他需求,比如检验所有数据的整体分布、或者多变量联合正态性,这些方法更合适:

场景A:把所有数据当作一个一维样本检验

如果确实需要将整个DataFrame的所有数据视为同一群体,先把数据扁平化转为一维数组再检验:

# 扁平化DataFrame到一维数组
flat_data = df.values.flatten()

# 执行正态性检验
stat, p_val = normaltest(flat_data)
print(f"整体数据的统计量:{stat:.2f}, p值:{p_val:.4f}")

⚠️ 注意:这种方式只在你明确需要把所有变量的数据合并为一个群体时才有意义,大多数数据分析场景下不推荐,因为不同变量通常有不同的量纲或业务含义。

场景B:结合可视化辅助验证

统计检验的结果会受样本量影响:样本量太大时,哪怕分布只是轻微偏离正态,p值也会很小(拒绝原假设);样本量太小时,即使分布明显非正态,也可能无法拒绝原假设。所以建议结合可视化方法:

  • 直方图:快速查看数据分布形状
    df.hist(bins=30, figsize=(10, 6), edgecolor='black')
    
  • QQ图:对比数据分位数与正态分布理论分位数的拟合程度
    import matplotlib.pyplot as plt
    from scipy.stats import probplot
    
    for col in df.columns:
        plt.figure(figsize=(6, 4))
        probplot(df[col], plot=plt)
        plt.title(f"QQ Plot for {col}")
    plt.show()
    

如果QQ图中的点基本落在直线上,说明数据接近正态分布。

场景C:检验多变量联合正态性

如果你需要检验的是多个变量的联合分布是否正态(而不是单变量逐列),normaltest就不适用了,这时可以用专门的多变量正态性检验工具,比如第三方库pingouin的multivariate_normality方法:

import pingouin as pg

# 多变量正态性检验
mv_test_result = pg.multivariate_normality(df, alpha=0.05)
print(f"多变量正态性检验结果:{'符合' if mv_test_result[1] else '不符合'}")
print(f"统计量:{mv_test_result[0]:.2f}, p值:{mv_test_result[2]:.4f}")

这个方法会返回多变量正态性检验的统计量、是否接受正态假设的判断以及p值。


内容的提问来源于stack exchange,提问作者Glenn G.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 10:29:34