匹配下划线分隔文件名并提取日期与当前时间比较
提取文件名中日期的正则解决方案
问题背景
需要筛选符合{Custom-prefix}_{SupplierName}_{8位数字日期}.csv格式的文件,提取日期判断是否属于过去7天。其中SupplierName可包含下划线、数字且长度不定,不能硬编码供应商列表。原正则(?<={prefix})([a-zA-Z0-9_]*)([0-9]{8})(?=\.csv)会贪婪匹配前缀到.csv之间的所有内容,无法拆分供应商名与日期。
正确正则方案
利用正则分组匹配,针对文件名的固定结构,精准拆分供应商名与日期:
prefix = "Custom-prefix" pattern = re.compile(fr"{prefix}_(.*)_([0-9]{{8}})\.csv")
正则逻辑说明
{prefix}_:匹配固定前缀及后续的下划线(.*):贪婪匹配所有内容直到最后一个下划线(因后续规则要求下划线后必须跟8位数字,因此会自动停在日期前的下划线位置),对应SupplierName_([0-9]{8}):匹配日期前的下划线及8位数字日期,将日期存入第二个分组\.csv:匹配文件后缀,确保文件名格式完全符合要求
使用示例
import re from datetime import datetime, timedelta prefix = "myprefix" pattern = re.compile(fr"{prefix}_(.*)_([0-9]{{8}})\.csv") # 测试文件名 test_filename = "myprefix_Shop_no24_20221009.csv" match_result = pattern.match(test_filename) if match_result: supplier = match_result.group(1) date_str = match_result.group(2) file_datetime = datetime.strptime(date_str, "%Y%m%d") # 判断是否在过去7天内 cutoff_date = datetime.now() - timedelta(days=7) if file_datetime >= cutoff_date: print(f"符合条件:文件={test_filename},供应商={supplier},日期={file_datetime.strftime('%Y-%m-%d')}") else: print(f"{test_filename} 日期超出过去7天范围") else: print(f"{test_filename} 不符合命名格式")
内容的提问来源于stack exchange,提问作者NorrinRadd
相关产品推荐
相关产品推荐

