Spark中基于Cust_id合并两个DataFrames的方法求助
解决方案:合并两个DataFrame并匹配相同Cust_id记录
你需要的是基于Cust_id列的外连接(Outer Join),而非unionByName——unionByName的作用是将两个DataFrame的行堆叠在一起,不会合并相同Cust_id的记录,只会给不匹配的列填充null,最终会出现重复的Cust_id行,无法满足你的需求。
实现代码
若使用PySpark:
# 基于Cust_id列执行外连接,合并两个DataFrame merged_df = DF1.join(DF2, on="Cust_id", how="outer") # 查看合并结果 merged_df.show()
若使用Pandas:
import pandas as pd # 基于Cust_id列执行外连接 merged_df = pd.merge(DF1, DF2, on="Cust_id", how="outer") # 打印合并结果 print(merged_df)
合并后预期结果
| Cust_id | 7/13/22 Data | 7/17/22 Data |
|---|---|---|
| 0001 | 1.423 | null |
| 0002 | 1.664 | null |
| 0003 | 2.451 | 1.345 |
| 0004 | 1.412 | 1.456 |
| 0005 | null | 2.111 |
| 0006 | null | 1.409 |
关键说明
how="outer"参数会保留两个DataFrame中所有的Cust_id记录:同时存在于两个DF中的Cust_id会合并为一行,仅存在于单个DF中的Cust_id会保留,对应缺失的列自动填充为null- 该方式完全匹配你期望的合并逻辑,解决了
unionByName无法合并相同Cust_id记录的问题
内容的提问来源于stack exchange,提问作者James
相关产品推荐
相关产品推荐

