基于Pandas按A、C分组计算B列的Z值
按A、C分组计算B列Z值的简便实现
先看我们的原始数据:
import pandas as pd test = pd.DataFrame( [[1, 10, 14], [1, 12, 14], [1, 20, 12], [1, 25, 12], [2, 18, 12], [2, 30, 14], [2, 4, 12], [2, 10, 14]], columns=['A', 'B', 'C'] )
对应的表格结构:
| A | B | C | |
|---|---|---|---|
| 0 | 1 | 10 | 14 |
| 1 | 1 | 12 | 14 |
| 2 | 1 | 20 | 12 |
| 3 | 1 | 25 | 12 |
| 4 | 2 | 18 | 12 |
| 5 | 2 | 30 | 14 |
| 6 | 2 | 4 | 12 |
| 7 | 2 | 10 | 14 |
需求很明确:按A、C分组,计算每组内B列的Z值(Z值公式:(x - 组均值) / 组标准差)
你已经手动通过分组求均值和标准差的方式拿到了各组统计值,但其实不用这么麻烦,pandas有更简洁的方式直接完成计算,完全不用手动合并均值标准差到原表。
方法一:用groupby.transform自定义计算
我们可以利用groupby.transform方法,让分组后的统计计算直接映射回原DataFrame的每一行,一步到位:
# 定义计算Z值的函数 def calc_zscore(x): return (x - x.mean()) / x.std() # 按A、C分组,对B列应用Z值计算 test['B_zscore'] = test.groupby(['A', 'C'])['B'].transform(calc_zscore)
运行后得到的结果:
| A | B | C | B_zscore | |
|---|---|---|---|---|
| 0 | 1 | 10 | 14 | -0.707107 |
| 1 | 1 | 12 | 14 | 0.707107 |
| 2 | 1 | 20 | 12 | -0.707107 |
| 3 | 1 | 25 | 12 | 0.707107 |
| 4 | 2 | 18 | 12 | 0.707107 |
| 5 | 2 | 30 | 14 | 0.707107 |
| 6 | 2 | 4 | 12 | -0.707107 |
| 7 | 2 | 10 | 14 | -0.707107 |
方法二:用scipy.stats.zscore结合groupby.transform
如果不想自己写函数,也可以直接用scipy里的现成Z值计算函数,搭配transform:
from scipy.stats import zscore test['B_zscore'] = test.groupby(['A', 'C'])['B'].transform(zscore)
这个方法和上面自定义函数的结果完全一致,适合追求简洁代码的场景。
为什么比手动计算更方便?
- 不用单独生成均值、标准差表再合并到原数据,避免了合并时可能出现的索引对齐问题
- 代码更简洁,逻辑更连贯,直接从原数据一步得到结果
- 自动处理分组内的所有行,不用手动对应每个元素的分组统计值
内容的提问来源于stack exchange,提问作者JSolomonCulp
相关产品推荐
相关产品推荐

