使用Python re.search()检测非法字符时的异常问题排查
我来帮你排查这个问题!你的代码出现异常的核心原因在于正则表达式的思路不对——你只列举了部分非法字符,但没覆盖所有可能的非法情况,而且这种“找非法字符”的方式本身就不如直接验证合法格式可靠。
首先拆解原代码的问题:
- 你的正则
[abcdefghijklmnopqrstuvwxyz@_!#$%^&*()<>?/\\|}{~:]只匹配了小写字母和部分符号,但完全没考虑大写字母、空格、中文、全角字符等其他非法字符;更奇怪的是,合法的1-0-0-0里没有这些字符,理论上应该返回False,如果它被判定为非法,可能是你测试的字符串里有隐藏的匹配字符(比如全角的-),但不管怎样,这种方法根本不可靠。 - 你的需求是只允许类似
1-2-3-4的字符串,这不仅要求字符只能是数字和-,还要求格式正确:不能以-开头/结尾,不能有连续的--,必须是数字和-交替出现。
正确的解决方案
换个思路:直接验证字符串是否完全符合合法格式,而不是去逐个找非法字符。这里给出修改后的代码:
import re def checkStringForUnallowables(test): # 正则说明: # ^ = 字符串开头 # \d+ = 匹配1个或多个数字(确保开头是数字) # (?:-\d+)* = 非捕获组,匹配0次或多次 "-数字" 组合(允许中间的分隔,避免连续--) # $ = 字符串结尾(确保结尾是数字,无多余字符) valid_pattern = re.compile(r'^\d+(?:-\d+)*$') if valid_pattern.fullmatch(test): print("String does not contain unallowables - returning False") return False else: print("String contains unallowables - returning True") return True
测试案例验证
- 输入
1-0-0-0:返回False(合法,符合要求) - 输入
asdf/asdf%:返回True(非法,包含字母/符号) - 输入
1--2/-123/123-:返回True(非法,格式错误) - 输入
456:返回False(如果你的需求允许单个数字;如果必须要有至少一个-,可以把正则改成^(\d+-)+\d+$)
这种方式的优势在于:
- 覆盖了所有非法情况,只要不符合合法格式的字符串都会被检测出来
- 同时验证了字符合法性和格式正确性,完全满足你的需求
内容的提问来源于stack exchange,提问作者Greg Roberts
相关产品推荐
相关产品推荐

