Python中如何组合正向和负向预查正则提取符合规则的token
符合需求的正则实现方案
最终正则表达式
(?<=^|\s)(?=.*?\d)(?!.*?[\-\/\\\._@*]{2})[a-zA-Z0-9\-\/\\\._@*]+(?=\s|$)
规则对应说明
- 前后断言
(?<=^|\s)和(?=\s|$):保证匹配到的是完整的token,不会匹配长token里的部分片段,token以空白分隔或者位于字符串首尾 - 正向预查
(?=.*?\d):确保当前匹配的token里至少存在1位数字,满足第一个规则的强制要求 - 负向预查
(?!.*?[\-\/\\\._@*]{2}):确保token里不存在两个连续的允许特殊字符,满足第二个规则的禁止要求 - 主体匹配
[a-zA-Z0-9\-\/\\\._@*]+:匹配由字母、数字、允许的特殊字符组成的token内容,你可以根据实际需求增删字符集里的特殊符号
测试验证
可匹配场景
输入文本:165271 agya678 yah@123 kj*12-
匹配结果:165271、agya678、yah@123、kj*12-,全部符合预期
排除场景
输入文本:ajh12-& 671%&i^
匹配结果:无匹配结果,符合排除要求
原有写法的问题修正
- 原来的正向预查
(?=\w*\d\w*)仅覆盖字母、数字、下划线,没有包含其他允许的特殊字符,会漏掉带其他特殊字符的合法token - 原来的负向预查
(?!=[\_\.\:\;\-\\\/\@\+]{2})写法错误,?!=是无效的断言语法,同时仅检查边界位置的连续特殊字符,没有覆盖整个token范围 - 使用
\b作为边界不合适,特殊字符与空白的交界处也会被识别为单词边界,容易出现片段匹配的问题
内容的提问来源于stack exchange,提问作者Suneha K S
相关产品推荐
相关产品推荐

