Python中DataFrame按周统计唯一值的数据透视表问题
问题描述
现有如下Python DataFrame数据:
| Week | Workstation | Reason |
|---|---|---|
| 1 | A | DD |
| 1 | A | DD |
| 1 | B | DD |
| 1 | C | FF |
需要按周统计Workstation和Reason的唯一值数量,期望输出:
| Week | Distinct_Workstation | Distinct_Reason |
|---|---|---|
| 1 | 3 | 2 |
尝试了以下代码但未得到正确结果:
df.pivot_table(index='Week', values=['Workstation', 'Reason'], aggfunc='nunique')
解决方法
你的代码逻辑本身是正确的,大概率是输出列名不符合预期,或是遇到了版本兼容问题。以下两种方式可实现需求:
方法一:重命名透视表列名
生成透视表后修改列名,匹配期望格式:
result = df.pivot_table(index='Week', values=['Workstation', 'Reason'], aggfunc='nunique') result.columns = ['Distinct_Workstation', 'Distinct_Reason'] result.reset_index(inplace=True)
方法二:使用groupby实现
用groupby结合agg更直观地指定统计规则和列名:
result = df.groupby('Week').agg( Distinct_Workstation=('Workstation', 'nunique'), Distinct_Reason=('Reason', 'nunique') ).reset_index()
若之前的pivot_table代码未得到正确结果,可检查pandas版本(nunique作为聚合函数需0.20.0及以上版本支持),或确认DataFrame中无空值干扰统计。
内容的提问来源于stack exchange,提问作者samronaldo309
相关产品推荐
相关产品推荐

