Python DataFrame日期列拆分:从年月组合中分离年月
拆分日期列成月份和年份的几种方法
嘿,这个需求在处理时间序列数据时太常见了!我给你分享几种基于pandas的实现方式,你可以根据自己的场景选择最合适的:
方法1:直接字符串切片(最快速,适合固定格式)
因为你的日期格式是固定的3个字母缩写+4位数字年份,直接用字符串切片是最高效的:
import pandas as pd # 假设你的DataFrame名为df df['Month'] = df['Date'].str[:3] # 提取前3个字符作为月份 df['Year'] = df['Date'].str[-4:] # 提取最后4个字符作为年份
这种方法不需要依赖任何复杂的解析,速度最快,完美适配你的固定格式场景。
方法2:正则表达式提取(灵活适配格式变化)
如果后续你的日期格式可能有变动(比如月份缩写长度不同),正则表达式会更灵活:
# 用正则匹配字母部分(月份)和数字部分(年份),直接拆分成两列 df[['Month', 'Year']] = df['Date'].str.extract(r'([A-Za-z]+)(\d+)', expand=True)
这个正则会自动把所有连续字母作为月份、连续数字作为年份,能适配更多格式变种。
方法3:转换为datetime对象提取(适合后续日期操作)
如果你之后还要对日期做排序、时间差计算等操作,把字符串转成datetime对象再提取会更方便,还能自动得到数值型的年份:
# 先将字符串转为datetime格式,指定格式为"月份缩写+年份" df['Date_dt'] = pd.to_datetime(df['Date'], format='%b%Y') # 提取月份缩写和年份 df['Month'] = df['Date_dt'].dt.strftime('%b') # 保持JAN/FEB这样的缩写 df['Year'] = df['Date_dt'].dt.year # 得到整数类型的年份(比如2014) # 如果不需要中间的Date_dt列,可以删除 df.drop('Date_dt', axis=1, inplace=True)
这种方法的优势是得到的Year是整数,方便后续做数值计算,同时保留了日期的结构化信息。
小提示
如果你的月份缩写有大小写混合的情况,可以用str.upper()或str.title()统一格式:
df['Month'] = df['Date'].str[:3].str.upper() # 转成大写 # 或者转为首字母大写:df['Month'] = df['Date'].str[:3].str.title()
内容的提问来源于stack exchange,提问作者RGRGRG
相关产品推荐
相关产品推荐

