You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python Pandas筛选单日小时数完整的营销活动数据

解决方案

给你三种直接落地的方法,把筛选结果应用到原始数据集:

方法1:提取有效组合后合并筛选

先修正你原代码的语法问题,提取出符合要求的id和date组合,再和原始表做内连接:

# 获取符合条件的(id, date)组合,重置索引将分组键转回列
valid_pairs = df.groupby(['id','date']).count().query("Hour > 23").reset_index()[['id','date']]
# 内连接原始数据,仅保留匹配的行
filtered_df = df.merge(valid_pairs, on=['id','date'], how='inner')

方法2:用元组集合做布尔索引

把有效组合转成元组集合,直接在原始数据里做筛选:

# 将符合条件的(id, date)转为元组集合
valid_set = set(df.groupby(['id','date']).count().query("Hour > 23").index)
# 筛选原始数据中(id, date)在集合内的行
filtered_df = df[df.apply(lambda row: (row['id'], row['date']) in valid_set, axis=1)]

方法3:用groupby.filter一步到位(最简洁)

不用生成中间表,直接通过分组筛选保留符合条件的原始行:

# 直接筛选出每个(id, date)分组中数据量≥24的所有原始记录
filtered_df = df.groupby(['id','date']).filter(lambda x: x['Hour'].count() > 23)

补充提示

如果Hour列没有缺失值,也可以用x.shape[0] > 23替代x['Hour'].count() > 23,结果完全一致。

内容的提问来源于stack exchange,提问作者Eugenio5

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.26 03:48:23