Python正则表达式:如何正确拆分含连续大写字母的字符串?
解决正则拆分字符串时拆分多字母字段名的问题
原正则表达式[a-zA-Z][^A-Z]*的问题在于,它仅匹配单个字母作为字段开头,当遇到IP这类由多个大写字母组成的字段名时,[^A-Z]*会在第二个大写字母P前停止匹配,导致I被单独拆分出来。
修改后的正则表达式
将开头的单个字母匹配改为连续字母匹配,即:
[a-zA-Z]+[^A-Z]*
完整代码示例
import re text = "Date: 20/8/2020 Duration: 0.33 IP: 110.1.x.x Server:01" my_list = re.findall('[a-zA-Z]+[^A-Z]*', text) print(my_list)
正则逻辑说明
[a-zA-Z]+:匹配字段名的连续字母(支持大小写组合,比如Date、IP)[^A-Z]*:匹配字段名后的所有内容,直到遇到下一个大写字母(新字段的起始标识)或字符串结尾,确保多字母字段名不会被拆分。
运行后输出结果符合预期:
['Date: 20/8/2020 ', 'Duration: 0.33 ', 'IP: 110.1.x.x ', 'Server:01']
内容的提问来源于stack exchange,提问作者sibhive
相关产品推荐
相关产品推荐

