如何用Pandas从文件名提取日期并为DataFrame新增Date列
嘿,这就帮你搞定这两个需求,一步步来实现:
实现步骤
首先确保你已经安装了pandas(re是Python标准库,无需额外安装),如果还没装pandas,先执行安装命令:
pip install pandas
1. 读取Excel文件为DataFrame
先定义好文件路径,再用pandas的read_excel方法读取文件:
import pandas as pd # 定义文件路径 Filename = '../BSOS Supplier Sales (01289), 02.04.2018 - 08.04.2018 (X).xlsx' # 读取文件为DataFrame df = pd.read_excel(Filename)
2. 提取日期段并新增"Date"列
这里用正则表达式精准匹配文件名里的日期区间——你的日期格式是固定的DD.MM.YYYY - DD.MM.YYYY,正则可以完美捕捉:
import re # 匹配日期段的正则表达式 date_regex = r'\d{2}\.\d{2}\.\d{4} - \d{2}\.\d{2}\.\d{4}' # 从文件名中提取目标日期段 extracted_date = re.search(date_regex, Filename).group() # 给DataFrame新增"Date"列并赋值 df['Date'] = extracted_date
验证结果
你可以通过以下代码确认操作是否成功:
# 打印提取的日期区间 print(f"提取的日期区间:{extracted_date}") # 查看新增列的前几行数据 print(df[['Date']].head())
这样就完成了你要求的所有操作~
内容的提问来源于stack exchange,提问作者jwlon81
相关产品推荐
相关产品推荐

