Scala中如何筛选DataFrame最新日期行并保留输入结构?
Scala通用筛选DataFrame最新日期行函数实现
你的原代码存在两个关键问题:
- 聚合函数
max()不能直接放在filter里使用——filter是逐行判断逻辑,而max是全局聚合操作,两者上下文不兼容,直接这么写会报错。 - 日期转换逻辑没必要转成整数类型,既增加了计算开销,也容易出现格式转换异常。
下面给你两种通用的实现方案,满足任意包含date字符串列(yyyy-MM-dd格式)的DataFrame筛选需求:
方案一:先求全局最大日期再过滤(高效简洁)
这种方法先计算出整个DataFrame里的最大日期,再用这个值过滤行,性能较好,适合大部分场景:
import org.apache.spark.sql.functions._ import org.apache.spark.sql.DataFrame def getLatestDateRows(table: DataFrame): DataFrame = { // 先获取全局最大日期字符串(yyyy-MM-dd格式字符串可直接比较大小) val maxDate = table.select(max("date")).first().getString(0) // 过滤出所有日期等于最大日期的行 table.filter(col("date") === maxDate) }
如果担心日期格式不标准,也可以先把date列转为日期类型再比较,避免字符串比较的潜在问题:
import org.apache.spark.sql.functions._ import org.apache.spark.sql.types.DateType import org.apache.spark.sql.DataFrame def getLatestDateRows(table: DataFrame): DataFrame = { // 将字符串日期转为Date类型 val dateTypedDf = table.withColumn("date_type", col("date").cast(DateType)) // 获取全局最大日期 val maxDate = dateTypedDf.select(max("date_type")).first().getDate(0) // 过滤后移除临时列,返回原结构的结果 dateTypedDf.filter(col("date_type") === lit(maxDate)) .drop("date_type") }
方案二:窗口函数实现(支持扩展分组场景)
如果之后需要扩展为分组筛选每组最新日期,用窗口函数更灵活,全局筛选也完全适用:
import org.apache.spark.sql.functions._ import org.apache.spark.sql.types.DateType import org.apache.spark.sql.Window import org.apache.spark.sql.DataFrame def getLatestDateRows(table: DataFrame): DataFrame = { val dateTypedDf = table.withColumn("date_type", col("date").cast(DateType)) // 定义全局窗口,按日期倒序排序 val globalWindow = Window.orderBy(col("date_type").desc) // 给每行添加行号,行号为1的就是最新日期的行 dateTypedDf.withColumn("row_rank", row_number().over(globalWindow)) .filter(col("row_rank") === 1) .drop("date_type", "row_rank") }
注意事项
- 如果
date列存在空值,建议先加filter(col("date").isNotNull)过滤,避免影响最大日期计算 - 若确定输入的
date列严格遵循yyyy-MM-dd格式,直接用字符串比较的方案一性能最优,无需类型转换
内容的提问来源于stack exchange,提问作者Qodek
相关产品推荐
相关产品推荐

