You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark中基于Cust_id合并两个DataFrames的方法求助

解决方案:合并两个DataFrame并匹配相同Cust_id记录

你需要的是基于Cust_id列的外连接(Outer Join),而非unionByName——unionByName的作用是将两个DataFrame的行堆叠在一起,不会合并相同Cust_id的记录,只会给不匹配的列填充null,最终会出现重复的Cust_id行,无法满足你的需求。

实现代码

若使用PySpark:

# 基于Cust_id列执行外连接,合并两个DataFrame
merged_df = DF1.join(DF2, on="Cust_id", how="outer")

# 查看合并结果
merged_df.show()

若使用Pandas:

import pandas as pd

# 基于Cust_id列执行外连接
merged_df = pd.merge(DF1, DF2, on="Cust_id", how="outer")

# 打印合并结果
print(merged_df)

合并后预期结果

Cust_id7/13/22 Data7/17/22 Data
00011.423null
00021.664null
00032.4511.345
00041.4121.456
0005null2.111
0006null1.409

关键说明

  • how="outer" 参数会保留两个DataFrame中所有的Cust_id记录:同时存在于两个DF中的Cust_id会合并为一行,仅存在于单个DF中的Cust_id会保留,对应缺失的列自动填充为null
  • 该方式完全匹配你期望的合并逻辑,解决了unionByName无法合并相同Cust_id记录的问题

内容的提问来源于stack exchange,提问作者James

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.26 03:45:49