You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何筛选满足ecom早于sales条件的MultiIndex DataFrame数据

Pandas MultiIndex分组筛选实现方案

实现逻辑

核心判断规则为:对每个(partner, employer)分组,仅保留首次ecom=1的日期早于首次sales=1的日期的分组的全部行。

具体代码实现

假设你已经构造好了对应的MultiIndex结构DataFrame,命名为df:

import pandas as pd

# 第一步:将date列转为datetime类型,避免字符串日期比较出现逻辑错误
# 原数据日期格式为月/日/年,因此format指定为%m/%d/%y
df['date'] = pd.to_datetime(df['date'], format='%m/%d/%y')

# 第二步:定义分组过滤规则
def check_group(g):
    # 获取当前组ecom首次为1的最早日期
    first_ecom_date = g[g['ecom'] == 1]['date'].min()
    # 获取当前组sales首次为1的最早日期
    first_sales_date = g[g['sales'] == 1]['date'].min()
    # 仅当两个有效日期都存在、且ecom日期更早时,保留该组全部行
    return pd.notna(first_ecom_date) and pd.notna(first_sales_date) and first_ecom_date < first_sales_date

# 第三步:按partner、employer分组执行过滤
# 因为是多级索引,直接指定level对应索引名即可
result_df = df.groupby(level=['partner', 'employer']).filter(check_group)

# 可选步骤:如果需要将日期转回原字符串显示格式
result_df['date'] = result_df['date'].dt.strftime('%m/%d/%y')

结果说明

示例中(A,b)分组的sales=1首次出现日期为2021-10-01,早于ecom=1的首次出现日期2021-10-02,因此该组所有行都会被排除,最终输出和你给出的预期结果完全一致。

内容的提问来源于stack exchange,提问作者gutedaama

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 10:15:03