You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何合并两个PySpark DataFrame:保留主表重复行并补充新行

PySpark DataFrame 合并解决方案

你的需求本质是保留第一个DataFrame的全部行,同时补充第二个DataFrame中主键组合(ID1、ID2、DATE)未在第一个表中出现的行,可以通过以下高效方法实现:

核心思路

  1. 用left_anti join快速筛选出第二个DataFrame中,主键组合不存在于第一个DataFrame的行
  2. 将第一个DataFrame和筛选后的行进行union,得到最终结果

代码实现

假设你的两个DataFrame分别命名为df1(第一个表)和df2(第二个表):

# 定义主键列
primary_keys = ["ID1", "ID2", "DATE"]

# 筛选df2中不在df1里的主键行
df2_unique = df2.join(df1, on=primary_keys, how="left_anti")

# 合并df1和df2的独有行
final_df = df1.union(df2_unique)

为什么这个方法可行?

  • left_anti join是Spark原生优化的操作,专门用于筛选"在表A中但不在表B中"的数据,处理几十万级数据性能优异
  • 不需要手动处理字段匹配(只要两个DF列名、数据类型一致),自动保留所有字段的原始值
  • 完全符合你的需求:主键重复时保留df1的行,仅补充df2独有的新行

注意事项

  • 确保两个DataFrame的列名、数据类型、列顺序完全一致,如果不一致,可通过select调整,比如:
    # 对齐df2的列顺序和df1一致
    df2 = df2.select(df1.columns)
    
  • 如果主键列的数据类型不一致(比如DATE列一个是字符串一个是日期类型),需要先统一类型再执行join操作

内容的提问来源于stack exchange,提问作者dawid2312

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 17:31:15