在PySpark中如何将timestamp值四舍五入到最接近的分钟?
PySpark 时间戳四舍五入到最近分钟实现方案
实现逻辑
核心思路是利用秒级时间戳做数值运算实现四舍五入,完全不需要依赖date_trunc函数,也不用引入pandas:
- 把timestamp类型列转为1970年以来的秒级时间戳整数
- 将秒数除以60得到以分钟为单位的数值,直接调用
round函数做常规四舍五入 - 四舍五入后的分钟数乘以60转回秒级时间戳,再转换回timestamp类型即可
代码实现
首先导入PySpark内置函数:
from pyspark.sql import functions as F
假设你待处理的DataFrame为df,时间戳列名为ts,新增四舍五入后的时间列ts_rounded的代码如下:
df = df.withColumn( "ts_rounded", F.to_timestamp(F.round(F.unix_timestamp("ts") / 60) * 60) )
效果验证
对照你给出的示例,运算结果完全符合预期:
- 原始值
2020-11-03 18:25:04:转秒数后除以60得到的数值小数部分为0.067,round后保留整数部分,乘以60转回为2020-11-03 18:25:00 - 原始值
2020-11-03 18:21:44:转秒数后除以60得到的数值小数部分为0.733,round后进一位,乘以60转回为2020-11-03 18:22:00
补充说明
如果你的Spark版本支持timestamp_seconds函数,也可以替换to_timestamp使用,效果完全一致,默认会使用Spark会话配置的时区,和原始数据时区对齐即可。
内容的提问来源于stack exchange,提问作者Artemination
相关产品推荐
相关产品推荐

