使用pandas groupby统计各事件分组下的唯一年份数量
Pandas分组统计每个类别对应唯一年份数并回填到原行
实现代码
直接用groupby搭配transform即可实现,不需要额外做表拼接:
import pandas as pd # 构建原始数据集 df = pd.DataFrame({ "CompanyEvents": ["Event1", "Event1", "Event1", "Event1", "Event1", "Event2", "Event2", "Event2", "Event3"], "StartDate:year": [2013, 2013, 2013, 2014, 2015, 2013, 2013, 2015, 2011] }) # 按CompanyEvents分组,统计每组内年份的去重数量,结果广播到组内每一行 df["Unique Year Count"] = df.groupby("CompanyEvents")["StartDate:year"].transform("nunique") # 重命名年份列,匹配目标输出格式 df = df.rename(columns={"StartDate:year": "Year"})
输出结果
运行代码后打印df即可得到你需要的结果:
CompanyEvents Year Unique Year Count 0 Event1 2013 3 1 Event1 2013 3 2 Event1 2013 3 3 Event1 2014 3 4 Event1 2015 3 5 Event2 2013 2 6 Event2 2013 2 7 Event2 2015 2 8 Event3 2011 1
实现说明
- 这里不用普通的
groupby().agg()是因为聚合操作会把结果压缩为每个分组1行,和原表行数不匹配 transform会保留原表的行索引结构,把每个分组的统计值填充到组内所有对应行,正好满足同组所有行计数值一致的需求nunique是pandas内置的去重计数函数,直接统计序列内的唯一值数量,不需要额外写取唯一值再算长度的冗余逻辑
内容的提问来源于stack exchange,提问作者Prime coder
相关产品推荐
相关产品推荐

