You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark 3.4自定义unix_micros函数在部分集群微秒计算异常求助

问题:Spark 3.4自定义unix_micros函数微秒部分异常的原因?

Spark 3.5+ 内置有unix_micros()函数,可返回自1970-01-01 00:00:00 UTC起的微秒数。因工作代码基于Spark 3.4,无该内置函数,自行实现了Scala版本的unix_micros函数:

def unix_micros(column: Column): Column {
  val columnName = column.toString
  unix_timestamp(column) * 1000000 + expr(s"CAST(date_format($columnName, 'SSSSSS') AS BIGINT)")
}

该函数在本地及部分集群运行正常,但在部分集群中,微秒部分会返回000123而非123456、000999而非999678。经排查,问题出在expr(s"CAST(date_format($columnName, 'SSSSSS') AS BIGINT)")的行为差异,请问是什么原因导致的?

原因分析

问题核心是不同环境下JDK版本对日期格式化模式SSSSSS的处理逻辑不一致:

  • Spark的date_format函数底层依赖JDK的日期格式化实现,在JDK 8早期版本中,SimpleDateFormat仅支持解析毫秒级(三位数字)的精度,当使用SSSSSS模式时,会将后三位补0,导致原本的123456变成000123、999678变成000999——因为它只取了前三位毫秒值,剩下的三位强制补0。
  • 而本地环境或部分集群使用了更新的JDK版本(或Spark对日期处理做了优化,比如使用DateTimeFormatter替代旧的SimpleDateFormat),这些环境能正确识别SSSSSS代表微秒级的六位数字,所以返回结果正常。

另外补充一个潜在问题:用column.toString获取列名的方式不可靠,如果传入的是复杂表达式(比如to_timestamp(col("dt"))),column.toString会返回整个表达式字符串,导致expr执行出错,建议改用column.expr或者直接通过列引用的方式构造表达式。

内容的提问来源于stack exchange,提问作者explorer

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.13 20:43:15