You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在分组Kruskal检验中排除样本量小于5的类别?

解决Kruskal检验排除小样本类别的问题

你可以通过两种方式过滤掉样本量小于5的treatment类别,再执行Kruskal检验:

方法1:在分组推导式中直接过滤

修改原列表推导式,加入对分组样本量的判断,只保留样本量≥5的组:

from scipy.stats import kruskal

# 过滤样本量≥5的分组,再提取变量值
valid_groups = [group["variable"].values for name, group in df.groupby("treatment") if len(group) >= 5]

# 执行Kruskal检验(确保至少有2个有效分组才会运行)
if len(valid_groups) >= 2:
    stat, p_val = kruskal(*valid_groups)
    print(f"Kruskal-Wallis统计量: {stat}, p值: {p_val}")
else:
    print("有效分组不足2个,无法执行Kruskal检验")

方法2:先预处理数据再分组

先通过filter方法筛选出符合样本量要求的行,再进行分组和检验,这种方式更直观:

from scipy.stats import kruskal

# 筛选出样本量≥5的treatment对应的所有行
filtered_df = df.groupby("treatment").filter(lambda x: len(x) >= 5)

# 对筛选后的数据分组并提取变量值
valid_groups = [group["variable"].values for name, group in filtered_df.groupby("treatment")]

# 执行检验
if len(valid_groups) >= 2:
    stat, p_val = kruskal(*valid_groups)
    print(f"Kruskal-Wallis统计量: {stat}, p值: {p_val}")
else:
    print("有效分组不足2个,无法执行Kruskal检验")

两种方法都能实现需求,第二种方法会生成一个仅包含有效分组的新DataFrame,后续如果还有其他分析需求也能直接使用。另外注意加入分组数量判断,因为Kruskal检验至少需要2个分组才能运行。

内容的提问来源于stack exchange,提问作者user3892

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.14 09:55:54