如何从pandas DataFrame的Edition列中正确提取对应日期数据
正确提取Edition列日期数据的方法
你的Edition列数据遵循固定格式:装订类型,– 日期,其中日期部分为日 月份缩写 四位数年份结构,按以下步骤操作即可:
方案1:字符串拆分后转换
先以,– 为分隔符拆分字符串,取第二部分的日期字符串,再转为datetime格式:
# 拆分字符串,提取日期部分 date_str = df_train['Edition'].str.split(',– ', expand=True)[1] # 转换为标准datetime格式 df_train['publish_date'] = pd.to_datetime(date_str, format='%d %b %Y')
参数说明:format='%d %b %Y' 匹配你的日期格式,能大幅提升转换速度,也可避免识别错误。如果存在个别格式不匹配的行,可添加errors='coerce'参数,将非法值转为空值NaT。
方案2:正则直接提取
通过正则匹配直接定位日期部分,无需拆分整个字符串,适合格式有微小波动的场景:
import re # 正则匹配 1-2位数字+空格+3位字母+空格+4位数字 的日期结构 date_str = df_train['Edition'].str.extract(r'(\d{1,2} \w{3} \d{4})', expand=False) df_train['publish_date'] = pd.to_datetime(date_str, format='%d %b %Y')
异常说明
你之前执行str.split后得到<function to_datetime at 0x00000262C3D72DC0>的返回结果,是因为你之前误将pd.to_datetime函数对象直接赋值给了Edition列,而非调用函数转换数据。你需要先还原Edition列为原始的字符串数据,再执行上述提取操作。
内容的提问来源于stack exchange,提问作者Lancelot DSouza
相关产品推荐
相关产品推荐

