如何在Python正则中忽略大小写但不忽略变音符号?
解决正则忽略大小写但保留变音符号匹配的问题
要实现忽略大小写但不忽略变音符号的正则匹配,核心是避免默认Unicode大小写折叠将带变音符号的字符(如İ)与普通字符(如i)视为等价。以下是两种可行方案:
方案一:使用regex库(推荐)
regex库原生支持POSIX字符类,且提供foldcase参数控制大小写匹配的严格程度:
- 默认
foldcase=True会启用宽松的Unicode折叠匹配(导致İ匹配普通i) - 设置
foldcase=False则使用精确的大小写映射,仅匹配字符的直接大小写变体(如İ仅匹配İ和其小写形式i̇,不匹配普通i)
修改后的代码示例:
import regex as re active_patterns = ["(İg)[[:punct:][:space:]]+[[:alnum:]]+"] text = "A big problem" target_text = "A İg problem" # 目标匹配文本 target_text_lower = "A i̇g problem" # 带变音符号的小写形式 for pattern in active_patterns: # 启用IGNORECASE但关闭宽松折叠 compiled_pattern = re.compile(pattern, re.IGNORECASE, foldcase=False) # 测试普通i的文本(无匹配) print("普通i文本匹配结果:") for match in compiled_pattern.finditer(text): print(match.group()) # 测试带变音符号的文本(正常匹配) print("\n带变音符号文本匹配结果:") for match in compiled_pattern.finditer(target_text): print(match.group()) for match in compiled_pattern.finditer(target_text_lower): print(match.group())
方案二:使用标准re库
标准re库不支持POSIX字符类,且无foldcase参数,需手动处理:
- 将POSIX字符类替换为等价的Unicode字符类(如
[:punct:]→\p{P},[:space:]→\s,[:alnum:]→\p{Alnum}) - 手动指定带变音符号字符的大小写变体,无需启用
IGNORECASE
代码示例:
import re # 手动指定İ的大小写变体:İ和i̇,g的大小写变体:G和g active_patterns = ["([İi̇][Gg])[\p{P}\s]+\p{Alnum}+"] text = "A big problem" target_text = "A İg problem" target_text_lower = "A i̇g problem" for pattern in active_patterns: compiled_pattern = re.compile(pattern) print("普通i文本匹配结果:") for match in compiled_pattern.finditer(text): print(match.group()) print("\n带变音符号文本匹配结果:") for match in compiled_pattern.finditer(target_text): print(match.group()) for match in compiled_pattern.finditer(target_text_lower): print(match.group())
两种方案都能实现:仅匹配带变音符号的字符的大小写变体,不会将其与普通无变音符号的字符混淆。
内容的提问来源于stack exchange,提问作者Paolo Magnani
相关产品推荐
相关产品推荐

