如何在PySpark DataFrame中按ID和姓名合并时间范围行
PySpark合并相同ID+Name的行,取最早Start Date和最晚End Date
输入DataFrame
| ID | Name | Start Date | End Date |
|---|---|---|---|
| 1 | John | 2022-06-29 20:00:00 | 2022-07-12 20:00:00 |
| 1 | John | 2022-01-02 19:00:00 | 2022-05-18 20:00:00 |
| 2 | Bob | 2021-07-05 20:00:00 | 2021-09-25 20:00:00 |
| 2 | Jack | 2022-04-24 20:00:00 | 2022-06-25 20:00:00 |
| 3 | Mike | 2021-10-31 20:00:00 | 2021-12-11 19:00:00 |
需求说明
当行的ID和Name完全相同时,合并为一行:
Start Date取该分组下的最早日期End Date取该分组下的最晚日期
期望输出DataFrame
| ID | Name | Start Date | End Date |
|---|---|---|---|
| 1 | John | 2022-01-02 19:00:00 | 2022-07-12 20:00:00 |
| 2 | Bob | 2021-07-05 20:00:00 | 2021-09-25 20:00:00 |
| 2 | Jack | 2022-04-24 20:00:00 | 2022-06-25 20:00:00 |
| 3 | Mike | 2021-10-31 20:00:00 | 2021-12-11 19:00:00 |
实现代码
通过PySpark的分组聚合操作即可实现,步骤如下:
- 初始化环境并导入依赖
from pyspark.sql import SparkSession from pyspark.sql import functions as F spark = SparkSession.builder.appName("MergeRows").getOrCreate()
- 创建输入DataFrame(若从外部数据源读取,替换为对应读取逻辑)
data = [ (1, "John", "2022-06-29 20:00:00", "2022-07-12 20:00:00"), (1, "John", "2022-01-02 19:00:00", "2022-05-18 20:00:00"), (2, "Bob", "2021-07-05 20:00:00", "2021-09-25 20:00:00"), (2, "Jack", "2022-04-24 20:00:00", "2022-06-25 20:00:00"), (3, "Mike", "2021-10-31 20:00:00", "2021-12-11 19:00:00") ] df = spark.createDataFrame(data, ["ID", "Name", "Start Date", "End Date"]) # 将日期字符串转为Timestamp类型,保证聚合逻辑的准确性 df = df.withColumn("Start Date", F.to_timestamp("Start Date")) \ .withColumn("End Date", F.to_timestamp("End Date"))
- 执行分组聚合得到结果
result_df = df.groupBy("ID", "Name") \ .agg(F.min("Start Date").alias("Start Date"), F.max("End Date").alias("End Date")) \ .orderBy("ID", "Name") # 可选操作:让输出顺序与示例一致 # 查看最终结果 result_df.show(truncate=False)
代码说明
groupBy("ID", "Name"):以ID和Name作为分组依据,确保只有两者完全匹配的行才会被归为一组F.min("Start Date"):提取分组内最早的开始时间F.max("End Date"):提取分组内最晚的结束时间orderBy("ID", "Name"):按需使用,用于对齐示例输出的行顺序
内容的提问来源于stack exchange,提问作者Jie Zhang
相关产品推荐
相关产品推荐

