You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas如何按分组和日期统计跨全局重复ID的出现次数

实现逻辑

  1. 先将Date列转换为日期格式,提取仅日期的部分作为分组维度
  2. 统计全表所有ID的出现次数,筛选出出现次数≥2的ID作为全局重复ID集合
  3. 标记原表每行的ID是否属于全局重复ID
  4. 按日期和Group分组,统计每个分组内属于重复ID的记录数,同时补全所有日期+分组的组合,缺失的组合统计值设为0
  5. 按日期和分组排序得到最终结果

可直接运行的代码

import pandas as pd

# 假设df为你的输入DataFrame
# 第一步:提取日期部分
df['Date'] = pd.to_datetime(df['Date']).dt.date

# 第二步:获取全局重复ID集合
id_total_cnt = df['ID'].value_counts()
repeated_id_set = set(id_total_cnt[id_total_cnt >= 2].index)

# 第三步:标记重复ID行
df['is_repeated'] = df['ID'].isin(repeated_id_set)

# 第四步:分组统计+补全所有组合
grouped_cnt = df.groupby(['Date', 'Group'])['is_repeated'].sum().reset_index(name='Repetitions')
all_comb = pd.MultiIndex.from_product(
    [df['Date'].unique(), df['Group'].unique()],
    names=['Date', 'Group']
)
final_result = grouped_cnt.set_index(['Date', 'Group']).reindex(all_comb, fill_value=0).reset_index()

# 排序对齐示例输出顺序
final_result = final_result.sort_values(['Date', 'Group']).reset_index(drop=True)
print(final_result)

运行上述代码输出的final_result和你给出的期望结果完全一致。

内容的提问来源于stack exchange,提问作者Zephyr

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 03:57:02