You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark中含MMM格式月份的字符串转Timestamp报错处理

PySpark解析MMM格式月份的日期字符串为Timestamp类型的解决方案

问题根源

你的报错主要来自两个点:

  1. 日期字符串中的年份是4位格式(2022),但你在格式字符串中用了yy(对应两位年份),格式与实际内容不匹配;
  2. Spark 3.0+版本提升了日期解析的严格性,同时MMM格式的英文月份缩写依赖英文区域设置,若环境默认locale非英文,也会导致解析失败。

正确解决方案

方案1:修正格式字符串并指定英文区域

将格式字符串中的yy替换为yyyy匹配4位年份,同时显式指定英文locale确保月份缩写能被正确解析:

import pyspark.sql.functions as F

master_ = master.withColumn(
    "datetime_london",
    F.to_timestamp("date_time", "dd-MMM-yyyy'T'HH:mm:ss", "en_US")
)

方案2:兼容默认英文locale的写法

如果你的Spark环境默认locale已经是英文,也可以省略locale参数,但显式指定能避免环境差异问题:

master_ = master.withColumn(
    "datetime_london",
    F.to_timestamp("date_time", "dd-MMM-yyyy'T'HH:mm:ss")
)

为什么之前的尝试失败

  • 移除格式中的T:原日期字符串里的T是日期与时间的分隔符,格式字符串必须和实际字符串的结构完全对应,移除后格式不匹配,触发解析错误;
  • 更换为"d-M-y'T'HH:mm:ss":这里的M对应数字类型的月份(如11),但你的字符串是英文缩写NOV,格式与内容类型不匹配,所以返回null。

内容的提问来源于stack exchange,提问作者jimmy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 22:30:53