You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Pandas DataFrame中通过排序聚合计算加权平均值

解决方案

步骤1:计算每个Process_Order_Number对应的加权平均值

先从原数据中筛选出parent批次,按Process_Order_Number分组,用你的加权平均逻辑计算每个组的结果:

import pandas as pd

def weighted_average(group):
    weights = group['Quantity']
    distribution = group['Value']
    return round(sum(distribution * weights)/sum(weights), 2)

# 示例数据集
A = pd.DataFrame({
    'Batch_ID': ['A', 'B', 'C', 'D', 'E', 'F'], 
    'Process_Order_Number': [1,1,1,2,2,2], 
    'Batch_type': ['parent', 'parent', 'output','parent', 'parent', 'output'],
    'Quantity': [10,20,15,5,25,50], 
    'Value': [2,3,1,4,0,1]
})

# 计算每个Process_Order_Number的加权平均
weighted_avg_results = A[A['Batch_type'] == 'parent'].groupby('Process_Order_Number').apply(weighted_average).reset_index(name='Weighted_Average')

步骤2:将加权平均值关联到对应的output批次

把计算好的结果合并回原DataFrame,仅在output批次的行填充值,parent批次留空:

# 合并原数据与加权平均结果
A = A.merge(weighted_avg_results, on='Process_Order_Number', how='left')

# 仅保留output批次的加权平均值,parent批次设为None
A['Weighted_Average'] = A.apply(lambda row: row['Weighted_Average'] if row['Batch_type'] == 'output' else None, axis=1)

# 查看前3行结果
print(A.head(3))

输出结果

Batch_ID  Process_Order_Number Batch_type  Quantity  Value  Weighted_Average
0        A                     1     parent        10      2               NaN
1        B                     1     parent        20      3               NaN
2        C                     1     output        15      1              2.67

关键说明

  • 你之前的方法仅筛选了重复或多类型的组,但未针对parent批次做聚合计算,也没有将结果映射到output行。
  • 通过先筛选parent数据分组计算,再用merge关联回原表,最后通过条件判断只填充output行的方式,精准实现需求。
  • 若要严格匹配示例中的2.66,可将round替换为向下取整逻辑(比如math.floor((sum(distribution * weights)/sum(weights))*100)/100),标准round函数对2.666...的处理结果为2.67。

内容的提问来源于stack exchange,提问作者FUNCODER

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 13:50:36