正则表达式非捕获组未按预期工作,如何仅匹配目标/字符?
正则匹配问题:仅捕获目标斜杠/的位置和内容
需求是匹配前面无空格、后面为空格、点或行尾的斜杠/,只关注这个/本身的位置和内容。
原测试代码及结果:
>>> import re >>> re.search(r"[^ ]/([ .]|$)", "Foo /markup/ bar") <re.Match object; span=(10, 13), match='p/ '>
这里匹配到的是p/ ,无法直接通过pos = m.start() + 1获取目标/的位置,尝试用非捕获组(?:)修改正则后,结果仍不符合预期:
>>> re.search(r"(?:[^ ])/(?:[ .]|$)", "Foo /markup/ bar") <re.Match object; span=(10, 13), match='p/ '>
期望得到的结果是仅捕获/,对应匹配信息为:
<re.Match object; span=(11, 11), match='/'>
问题分析
用非捕获组没生效的核心原因是:正则里的[^ ]和后面的[ .]|$仍然属于匹配范围,不管是不是捕获组,整个正则匹配的内容还是包含了斜杠前后的字符,所以返回的match对象依然是p/ 。
解决方案
要只捕获目标/,需要用零宽断言来限定前后的条件,而非将前后字符包含在匹配范围内:
- 用
(?<! )(负向后行断言)确保/前面不是空格 - 用
(?=[ .]|$)(正向前瞻断言)确保/后面是空格、点或行尾
修改后的正则及测试结果:
>>> import re >>> re.search(r"(?<! )/(?=[ .]|$)", "Foo /markup/ bar") <re.Match object; span=(11, 12), match='/'>
注:Python的match对象span是左闭右开区间,span=(11,12)对应的就是索引11位置的/,和你期望的span=(11,11)逻辑一致,只是Python的区间表示方式不同。
内容的提问来源于stack exchange,提问作者buhtz
相关产品推荐
相关产品推荐

