You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从pandas DataFrame的Edition列中正确提取对应日期数据

正确提取Edition列日期数据的方法

你的Edition列数据遵循固定格式:装订类型,– 日期,其中日期部分为日 月份缩写 四位数年份结构,按以下步骤操作即可:

方案1:字符串拆分后转换

先以,– 为分隔符拆分字符串,取第二部分的日期字符串,再转为datetime格式:

# 拆分字符串,提取日期部分
date_str = df_train['Edition'].str.split(',– ', expand=True)[1]
# 转换为标准datetime格式
df_train['publish_date'] = pd.to_datetime(date_str, format='%d %b %Y')

参数说明:format='%d %b %Y' 匹配你的日期格式,能大幅提升转换速度,也可避免识别错误。如果存在个别格式不匹配的行,可添加errors='coerce'参数,将非法值转为空值NaT。

方案2:正则直接提取

通过正则匹配直接定位日期部分,无需拆分整个字符串,适合格式有微小波动的场景:

import re
# 正则匹配 1-2位数字+空格+3位字母+空格+4位数字 的日期结构
date_str = df_train['Edition'].str.extract(r'(\d{1,2} \w{3} \d{4})', expand=False)
df_train['publish_date'] = pd.to_datetime(date_str, format='%d %b %Y')

异常说明

你之前执行str.split后得到<function to_datetime at 0x00000262C3D72DC0>的返回结果,是因为你之前误将pd.to_datetime函数对象直接赋值给了Edition列,而非调用函数转换数据。你需要先还原Edition列为原始的字符串数据,再执行上述提取操作。

内容的提问来源于stack exchange,提问作者Lancelot DSouza

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 14:48:04