正则表达式如何仅匹配连续2个# 解决多#误匹配、前后字符不匹配问题
问题原因分析
你之前用的正则^##.*##$存在两个设计缺陷:
- 加了行首锚点
^和行尾锚点$,强制要求匹配内容必须占满整行,因此行内的双#片段(比如前后带其他文字的firstword ##helloworld## lastword)无法被识别 - 没有对
#的数量做边界校验,连续3个及以上#组成的字符串中,会自动截取前2个/后2个#作为匹配目标,导致误判###helloworld###这类不符合要求的内容
可行正则方案
使用带负向零宽断言的正则,精准匹配「前后均无额外#的连续2个#」包裹的内容:
(?<!#)##(?!#)(.*?)(?<!#)##(?!#)
正则各部分说明
(?<!#):负向后行断言,校验当前位置的前一个字符不是###:匹配连续2个#(?!#):负向前瞻断言,校验当前位置的后一个字符不是#,和前后的断言配合,保证这里匹配的一定是恰好2个连续#,不会把3个及以上连续#中的片段误算进来(.*?):非贪婪模式匹配两个合法双#之间的任意内容,避免跨多个双#块出现长匹配- 结尾的
(?<!#)##(?!#):和开头的双#校验逻辑一致,匹配闭合位置的合法双#
匹配效果验证
- 可正常匹配的场景:
firstword ##helloworld## lastword:精准命中片段##helloworld####helloworld##:整行命中
- 不会误匹配的场景:
###helloworld###:开头、结尾都是3个连续#,无匹配#helloworld#:单#包裹,无匹配##helloworld###:结尾为3个连续#,无匹配
如果你使用的正则引擎不支持负向零宽断言(比如极老版本的JavaScript引擎),可以换用兼容写法:
(^|[^#])##([^#].*?[^#])##([^#]|$),匹配后取第二个捕获组的内容即可。
内容的提问来源于stack exchange,提问作者uncowandy
相关产品推荐
相关产品推荐

