使用re.sub()解析字符串数字内容时多模式匹配出错的问题
正则提取数字的错误分析与修复
错误原因
你的正则表达式把三个前缀(avenue/road/lane)各自绑定了独立的捕获组,替换时只引用了第一个捕获组\1:
- 匹配
avenue12时,第一个分支avenue(\d+)生效,\1对应捕获到的12,所以输出正确; - 匹配
road12时,第二个分支road(\d+)生效,此时第一个捕获组是空的,真正的数字在第二个捕获组\2里,但你没引用它,所以输出空字符串。
修复方案
不需要给每个分支单独加捕获组,把所有前缀用非捕获组包裹,统一捕获后面的数字,这样不管匹配哪个前缀,数字都在同一个捕获组里:
方案1:统一捕获必选数字(适用于avenue/road/lane后都有至少一位数字的场景)
import re result = re.sub(r'(?:avenue|road|lane)(\d+)', r'\1', 'road12') print(result) # 输出:12
方案2:兼容lane后无数字的场景(对应你原正则里的lane(\d*))
import re # 用\1\2合并两个捕获组的内容,确保不管匹配哪个分支都能拿到数字 result = re.sub(r'(?:avenue|road)(\d+)|lane(\d*)', r'\1\2', 'lane') print(result) # 输出空字符串;若输入lane78则输出78
内容的提问来源于stack exchange,提问作者ilan
相关产品推荐
相关产品推荐

