You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas如何筛选含指定Item的全Batch数据并进行分组聚合

Pandas 按Batch条件过滤后聚合实现方法

正确实现代码

import pandas as pd

# 示例DataFrame
df_batches = pd.DataFrame({"Item":['Can','Liquid','Label','Liquid2', 'Can', 'Sugar'],
                           "Unit_cost": [.14, .45, .17, 1, .16, 23],
                           "Product":['Prod1', 'Prod1', 'Prod1', 'Prod1', 'Prod1', 'Prod1'],
                           "Batch":['5,100','5,100','5,100','5,101','5,101','5,101'], 
                           "Total_cost": [452, 789.34, 11115.28, 3220.98, 3542, 512.34],
                           "Year": ['2019', '2019', '2019', '2019', '2019', '2019'],
                          })

# 方法1:用transform实现(你之前预想的思路)
# 步骤1:过滤出所有包含Label的Batch对应的全部行
batch_mask = df_batches.groupby('Batch')['Item'].transform(lambda x: x.str.contains('Label').any())
filtered_df = df_batches[batch_mask]

# 步骤2:按指定字段分组对Total_cost求和
label_df = filtered_df.groupby(['Product', 'Batch', 'Year', 'Item'], as_index=False)['Total_cost'].sum()
# 方法2:先提取有效Batch列表再过滤(写法更直观)
valid_batches = df_batches[df_batches['Item'].str.contains('Label')]['Batch'].unique()
filtered_df = df_batches[df_batches['Batch'].isin(valid_batches)]
label_df = filtered_df.groupby(['Product', 'Batch', 'Year', 'Item'], as_index=False)['Total_cost'].sum()

逻辑说明

你之前的写法是先筛选Item包含Label的行再聚合,自然只能拿到Label对应的单条数据。正确逻辑是先判断整组Batch是否满足「存在Item包含Label」的条件,满足的组所有行都保留,再做后续聚合:

  • transform方法会返回和原DataFrame长度一致的布尔序列,同个Batch的所有行都会拿到相同的布尔值:如果该Batch存在Label相关Item则为True,否则为False,用来做行过滤刚好符合需求。
  • 第二种方法先筛选出所有带Label的Batch编号,再用isin匹配过滤,逻辑更易读,性能也和transform写法基本一致。

内容的提问来源于stack exchange,提问作者chasedcribbet

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 09:48:00