正则匹配提取指定分组失败:如何获取EDIFACT文本中的日期
解决EDIFACT文本日期提取的正则问题
首先直接回答你的疑问:没错,re.search()(或者re.match())会返回一个带.group()方法的匹配对象,能直接提取指定分组;而re.findall()的行为是返回所有捕获分组的内容集合,这也是你当前遇到问题的核心原因。
问题分析
你的正则表达式^((?:INV)\+(?:[^+\n]*\+){4})\d{8}存在两个关键问题:
- 目标日期
\d{8}没有被放进捕获分组,反而把前面的INV+...+部分放在了分组1中 re.findall()默认会返回所有捕获分组的内容,所以你得到的是前面的前缀字符串,而不是想要的日期
解决方案1:调整正则,用re.findall()直接提取日期
修改正则,把日期部分设为唯一的捕获分组,前面的前缀用非捕获分组((?:...))包裹,这样findall()会直接返回所有匹配的日期:
import re # 调整后的正则:仅捕获日期部分 regex = r"^INV\+(?:[^+\n]*\+){4}(\d{8})" with open("test edifakt 1 bk v1.txt", "r") as f: result = re.findall(regex, f.read(), re.MULTILINE) # 如果文件中只有一个目标日期,取列表第一个元素即可 if result: print(result[0]) # 输出:20080702
解决方案2:用re.search()提取单个匹配日期
如果你只需要提取第一个出现的目标日期,re.search()会更直观,它返回匹配对象后可以直接通过.group(1)获取日期分组:
import re regex = r"^INV\+(?:[^+\n]*\+){4}(\d{8})" with open("test edifakt 1 bk v1.txt", "r") as f: content = f.read() match_obj = re.search(regex, content, re.MULTILINE) if match_obj: print(match_obj.group(1)) # 直接输出目标日期:20080702
为什么之前的代码报错?
- 你调用
result.group(0)时报错,是因为re.findall()返回的是字符串列表,列表没有.group()方法,这个方法属于re.Match对象 - 把
group(0)传入re.findall()自然会报错,因为group不是一个预定义的变量,它是匹配对象的专属方法
内容的提问来源于stack exchange,提问作者skdadle
相关产品推荐
相关产品推荐

