You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在PySpark中合并仅age列不同的DataFrame行并保留最大age值?

在PySpark中合并DataFrame并保留age最大值的实现方法

你可以通过合并DataFrame + 分组聚合取最大值的方式实现需求,具体操作如下:

操作步骤

  1. 合并两个DataFrame:推荐使用unionByName替代union,避免因列顺序不一致引发的问题;
  2. 以firstName和lastName作为分组依据,对age列取最大值,完成重复行的合并。

完整代码示例

from pyspark.sql import SparkSession
from pyspark.sql.functions import max

# 初始化SparkSession
spark = SparkSession.builder.appName("merge_df_max_age").getOrCreate()

# 创建DataframeA
data_a = [("Alex", "Smith", 19), ("Rick", "Mart", 18)]
df_a = spark.createDataFrame(data_a, ["firstName", "lastName", "age"])

# 创建DataframeB
data_b = [("Alex", "Smith", 21)]
df_b = spark.createDataFrame(data_b, ["firstName", "lastName", "age"])

# 合并两个DataFrame
merged_df = df_a.unionByName(df_b)

# 分组聚合取age最大值
result_df = merged_df.groupBy("firstName", "lastName").agg(max("age").alias("age"))

# 展示结果
result_df.show()

运行后输出结果:

+---------+--------+---+
|firstName|lastName|age|
+---------+--------+---+
|     Alex|   Smith| 21|
|     Rick|    Mart| 18|
+---------+--------+---+

内容的提问来源于stack exchange,提问作者Trayambak

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 00:02:26