如何在PySpark中合并仅age列不同的DataFrame行并保留最大age值?
在PySpark中合并DataFrame并保留age最大值的实现方法
你可以通过合并DataFrame + 分组聚合取最大值的方式实现需求,具体操作如下:
操作步骤
- 合并两个DataFrame:推荐使用
unionByName替代union,避免因列顺序不一致引发的问题; - 以
firstName和lastName作为分组依据,对age列取最大值,完成重复行的合并。
完整代码示例
from pyspark.sql import SparkSession from pyspark.sql.functions import max # 初始化SparkSession spark = SparkSession.builder.appName("merge_df_max_age").getOrCreate() # 创建DataframeA data_a = [("Alex", "Smith", 19), ("Rick", "Mart", 18)] df_a = spark.createDataFrame(data_a, ["firstName", "lastName", "age"]) # 创建DataframeB data_b = [("Alex", "Smith", 21)] df_b = spark.createDataFrame(data_b, ["firstName", "lastName", "age"]) # 合并两个DataFrame merged_df = df_a.unionByName(df_b) # 分组聚合取age最大值 result_df = merged_df.groupBy("firstName", "lastName").agg(max("age").alias("age")) # 展示结果 result_df.show()
运行后输出结果:
+---------+--------+---+ |firstName|lastName|age| +---------+--------+---+ | Alex| Smith| 21| | Rick| Mart| 18| +---------+--------+---+
内容的提问来源于stack exchange,提问作者Trayambak
相关产品推荐
相关产品推荐

