You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何计算两timestamp列的分钟差值并筛选差值>15分钟的数据

Spark DataFrame计算时间差并筛选

问题本质

你踩了Spark和Pandas API混淆的坑:Spark里两个timestamp列相减得到的是IntervalType类型,而.dt.total_seconds()是Pandas专属方法,Spark DataFrame不支持这个调用,自然失效。

直接可用的解决方案

Spark有内置的时间差处理方式,两种写法任选:

写法一:通过类型转换计算

import pyspark.sql.functions as f

# 计算分钟差并筛选出差值>15分钟的行
filtered_df = (sample_df
               # 将timestamp转成long型(对应秒级时间戳),相减后除以60得到分钟
               .withColumn("diff_minutes", (f.col("current_time").cast("long") - f.col("device_time").cast("long")) / 60)
               # 应用筛选条件
               .filter(f.col("diff_minutes") > 15)
              )

# 查看结果
filtered_df.show()

写法二:用unix_timestamp函数更直观

filtered_df = (sample_df
               # 直接用unix_timestamp获取秒级时间戳,计算差值后转分钟
               .withColumn("diff_minutes", (f.unix_timestamp("current_time") - f.unix_timestamp("device_time")) / 60)
               .filter(f.col("diff_minutes") > 15)
              )

针对你的测试数据说明

你的示例数据中,current_time和device_time的实际差值约8.5秒,转成分钟仅0.14分钟,所以不会被筛选出来。可以找一组差值超过15分钟的测试数据验证逻辑是否生效。

内容的提问来源于stack exchange,提问作者Jilinnie Park

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.03 13:45:28