You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在R中基于另一个DataFrame实现SUMIFS功能?

高效解决方案(基于Pandas矢量操作)

针对30万级别的保单数据,绝对不能用遍历的方式,直接用Pandas的内置分组、透视和合并操作,完全是矢量运算,效率拉满:

核心代码

import pandas as pd

# 1. 对data_df按保单号+参考号分组求和,转成宽表结构
summed_df = data_df.groupby(['Policy No.', 'Reference No.'])['Local Currency'].sum().unstack()

# 2. 和combined_df左连接,保留所有保单号
output_df = combined_df.set_index('Policy No.').join(summed_df, how='left')

# 3. 填充缺失值为0,恢复原数据结构
output_df = output_df.fillna(0).astype(int).reset_index()

步骤解释

  • 分组求和+转宽表:groupby同时按Policy No.和Reference No.聚合,对Local Currency求和后,unstack()把参考号从行维度转成列维度,直接得到每个保单对应各参考号的求和结果,这一步是Pandas底层优化的矢量操作,比循环快几个数量级。
  • 左连接保留全量保单:把combined_df的保单号设为索引后做左连接,确保不会丢失任何一个原始保单(比如示例中的123123)。
  • 补全缺失值:把连接后产生的NaN填充为0,转成整数类型,再重置索引,最终结果和你需要的output_df完全一致。

内容的提问来源于stack exchange,提问作者yowhatsup

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.28 19:01:01