You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用pandas groupby统计各事件分组下的唯一年份数量

Pandas分组统计每个类别对应唯一年份数并回填到原行

实现代码

直接用groupby搭配transform即可实现,不需要额外做表拼接:

import pandas as pd

# 构建原始数据集
df = pd.DataFrame({
    "CompanyEvents": ["Event1", "Event1", "Event1", "Event1", "Event1", "Event2", "Event2", "Event2", "Event3"],
    "StartDate:year": [2013, 2013, 2013, 2014, 2015, 2013, 2013, 2015, 2011]
})

# 按CompanyEvents分组,统计每组内年份的去重数量,结果广播到组内每一行
df["Unique Year Count"] = df.groupby("CompanyEvents")["StartDate:year"].transform("nunique")

# 重命名年份列,匹配目标输出格式
df = df.rename(columns={"StartDate:year": "Year"})

输出结果

运行代码后打印df即可得到你需要的结果:

CompanyEvents  Year  Unique Year Count
0        Event1  2013                  3
1        Event1  2013                  3
2        Event1  2013                  3
3        Event1  2014                  3
4        Event1  2015                  3
5        Event2  2013                  2
6        Event2  2013                  2
7        Event2  2015                  2
8        Event3  2011                  1

实现说明

  • 这里不用普通的groupby().agg()是因为聚合操作会把结果压缩为每个分组1行,和原表行数不匹配
  • transform会保留原表的行索引结构,把每个分组的统计值填充到组内所有对应行,正好满足同组所有行计数值一致的需求
  • nunique是pandas内置的去重计数函数,直接统计序列内的唯一值数量,不需要额外写取唯一值再算长度的冗余逻辑

内容的提问来源于stack exchange,提问作者Prime coder

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.02 22:09:37