Python正则:re.findall与re.finditer匹配及输出差异解析
re.findall与re.finditer的匹配逻辑及输出差异解析
核心差异在于两者对捕获组的处理方式完全不同:
re.findall 的行为
re.findall的返回结果直接由正则表达式中的捕获组决定:
- 当正则无捕获组时,返回所有完整匹配的字符串列表
- 当正则有捕获组时,优先返回每个匹配中捕获组匹配到的内容;如果存在多个捕获组,会返回元组列表
结合你的测试代码来看,正则表达式r"[a-z]+('[a-z])?[a-z]*"包含一个可选捕获组('[a-z]),所以findall会提取每个匹配里该捕获组的内容:
- "please":捕获组未匹配,返回空字符串
- "sir":捕获组未匹配,返回空字符串
- "that's":捕获组匹配到
's,返回's - "obviously"、"a"、"clip"、"on":捕获组均未匹配,返回空字符串
最终得到结果:['', '', "'s", '', '', '', '']
re.finditer 的行为
re.finditer返回的是Match对象的迭代器,每个Match对象存储了当前匹配的全部信息(完整匹配内容、捕获组内容、匹配位置等):
- 调用
match_obj.group()(等价于group(0))会返回整个正则匹配的完整字符串 - 若要获取单个捕获组的内容,需调用
group(1)、group(2)等对应编号的方法
你的代码中遍历迭代器时,通过match_obj.group()提取了每个匹配的完整内容,因此得到所有完整匹配的结果:['please', 'sir', "that's", 'obviously', 'a', 'clip', 'on']
如何让 findall 返回完整匹配结果
如果想用findall得到和finditer+group()一致的结果,有两种方法:
- 将捕获组改为非捕获组(用
(?:...)语法),让正则仅用于匹配但不捕获:result = re.findall(r"[a-z]+(?: '[a-z])?[a-z]*", target_string) # 结果:['please', 'sir', "that's", 'obviously', 'a', 'clip', 'on'] - 用一个外层捕获组包裹整个正则,让
findall返回该外层组的内容(即完整匹配):result = re.findall(r"([a-z]+('[a-z])?[a-z]*)", target_string) # 结果:[('please', ''), ('sir', ''), ("that's", "'s"), ('obviously', ''), ('a', ''), ('clip', ''), ('on', '')] # 此时取每个元组的第一个元素即可得到完整匹配
内容的提问来源于stack exchange,提问作者saturn366
相关产品推荐
相关产品推荐

