如何统计DataFrame事件列中重复eventDateTime的出现次数
解决方法
要统计events列中eventDateTime重复的事件数量,可按以下步骤实现:
步骤1:展开事件列表
用explode把events列里的每个事件拆成单独一行,将嵌套列表转化为可处理的行数据:df_exploded = df.explode('events', ignore_index=True)步骤2:提取eventDateTime字段
从展开后的事件对象中提取eventDateTime值,生成独立列:df_exploded['eventDateTime'] = df_exploded['events'].apply(lambda x: x['eventDateTime'])步骤3:统计重复事件数量
方法一:先统计每个eventDateTime的出现次数,筛选出出现次数>1的项并求和,得到重复事件总数:count_series = df_exploded['eventDateTime'].value_counts() duplicate_total = count_series[count_series > 1].sum()方法二:直接标记所有重复的行(包含第一次出现的重复值),统计标记为
True的行数:duplicate_total = df_exploded['eventDateTime'].duplicated(keep=False).sum()步骤4:查看结果
打印统计出的重复事件总数:print(f"重复的事件数量:{duplicate_total}")
内容的提问来源于stack exchange,提问作者sman
相关产品推荐
相关产品推荐

