You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark实现DataFrame合并:保留df1全量+df2新id记录

用PySpark Join实现DataFrame合并需求

嘿,这个需求用PySpark的Join操作就能轻松搞定,我给你整理了具体的实现步骤和代码:

核心思路

我们的目标是保留df1的全部记录,再加上df2中id没在df1出现过的行。这里可以用**反连接(Anti Join)**先从df2里筛出符合条件的子集,再和df1合并就好——反连接刚好是专门用来提取“某表中在另一表无匹配主键”的记录的Join类型,完美契合我们的需求。

具体代码实现

假设你已经初始化好SparkSession,并且有了df1和df2两个DataFrame,直接跑下面的代码就行:

# 第一步:用反连接筛选df2中id不在df1的记录
df2_only = df2.join(df1, on="id", how="anti")

# 第二步:合并df1和筛选后的df2子集
final_df = df1.union(df2_only)

# 查看最终结果
final_df.show()

代码细节解释

  • 反连接(how="anti"):这里我们把df2作为左表,df1作为右表,Join后只会返回df2中那些在df1里找不到对应id的行,也就是我们需要补充的记录。
  • union():因为df1和df2的列结构完全一致(都是id、time、other),直接用union就能把两个DataFrame的行合并到一起,保留df1的全部内容,再加上筛选后的df2记录。

运行结果验证

执行完代码后,final_df的输出就和你预期的一模一样:

+---+-----------+-----+
| id|       time|other|
+---+-----------+-----+
|111|29-12-2019 |   p1|
|222|29-12-2019 |   p2|
|333|29-12-2019 |   p3|
|444|30-12-2019 |   p0|
+---+-----------+-----+

小提示

如果你的df1和df2列顺序不一样,记得先对齐列顺序再做union,避免数据错位:

# 把df2筛选后的子集调整成和df1一样的列顺序
df2_only = df2_only.select(df1.columns)
final_df = df1.union(df2_only)

内容的提问来源于stack exchange,提问作者Hina Patidar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 09:04:44