You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Pandas按分组统计数据框中的异常值数量?

Pandas按分组统计异常值数量的有效方案

我之前也碰到过类似的问题——直接用全局IQR计算异常值的话,完全不符合分组统计的需求,结果自然不对。下面给你两个实用的方案,都是基于分组内计算IQR来统计异常值数量的:

方案一:用groupby.apply自定义统计函数

这个方法简洁直接,针对每个分组单独计算IQR和异常值数量:

import pandas as pd
import numpy as np

# 先模拟一份样例数据(你可以替换成自己的数据集)
np.random.seed(42)
df = pd.DataFrame({
    'group': ['A', 'A', 'A', 'B', 'B', 'B', 'B', 'C', 'C'],
    'value': [10, 12, 15, 20, 22, 100, 25, 5, 50]
})

# 定义异常值统计函数
def count_group_outliers(group_data):
    q1 = group_data.quantile(0.25)
    q3 = group_data.quantile(0.75)
    iqr = q3 - q1
    # 计算异常值上下边界
    lower_limit = q1 - 1.5 * iqr
    upper_limit = q3 + 1.5 * iqr
    # 统计当前分组内的异常值数量
    return len(group_data[(group_data < lower_limit) | (group_data > upper_limit)])

# 按分组统计异常值
outlier_result = df.groupby('group')['value'].apply(count_group_outliers)
print(outlier_result)

运行后会得到每个分组的异常值数量,比如样例中分组B有1个异常值(100),分组C有1个异常值(50),分组A没有异常值。

方案二:用transform生成分组边界,标记后统计

如果你需要保留原始数据并查看每个数据点是否为异常值,这个方法更合适:

# 计算每个分组的四分位数、IQR和边界
df['q1'] = df.groupby('group')['value'].transform(lambda x: x.quantile(0.25))
df['q3'] = df.groupby('group')['value'].transform(lambda x: x.quantile(0.75))
df['iqr'] = df['q3'] - df['q1']
df['lower_bound'] = df['q1'] - 1.5 * df['iqr']
df['upper_bound'] = df['q3'] + 1.5 * df['iqr']

# 标记是否为异常值
df['is_outlier'] = (df['value'] < df['lower_bound']) | (df['value'] > df['upper_bound'])

# 按分组统计异常值数量
outlier_count = df.groupby('group')['is_outlier'].sum()
print(outlier_count)

这个方法会在原数据框中新增列,帮你直观看到每个数据点的异常状态,之后再分组求和就能得到数量。

为什么之前的方法无效?

大概率是你没有在每个分组内部计算IQR,而是全局计算了四分位数,导致边界不匹配每个分组的数据分布,统计结果自然出错。上面两个方案都是严格在分组内计算边界,能准确统计每个组的异常值。

内容的提问来源于stack exchange,提问作者ATMA

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 10:18:06