You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas如何按重复id分组填充NaN且保留所有原始列

实现方案

你之前用groupby().sum()会丢失列是因为聚合操作会将每个分组压缩为单行,而使用transform方法可以返回和原数据集行数一致的结果,完美保留所有原始列。

这里提供两种可选实现:

方案1:基于item_cost重新计算订单总额(更准确)

按照你对order_total的定义(同id所有item_cost的总和),直接重新计算更稳妥,不受原始order_total可能存在的错误影响:

df['order_total'] = df.groupby('id')['item_cost'].transform('sum')

方案2:沿用原始非空order_total填充NaN

如果你确定原始数据里同id的非空order_total是正确值,不需要重新计算,仅填充缺失值即可,可以用:

# 方法A:取分组内第一个非空值填充所有行
df['order_total'] = df.groupby('id')['order_total'].transform('first')

# 方法B:前后向填充适配更多缺失场景
df['order_total'] = df.groupby('id')['order_total'].transform(lambda x: x.ffill().bfill())

处理后的数据结果如下,所有原始列完整保留:

id item  item_cost  order_total
0   1    A          6           10
1   1    B          4           10
2   2    A          5            5
3   3    C         12           12

内容的提问来源于stack exchange,提问作者Phillip Schikora

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 18:24:07