Python中如何提取多组指定字符间的字符串?
解决正则贪婪匹配导致的多结果提取问题
嘿,你遇到的问题是正则表达式里的.*属于贪婪匹配——它会尽可能抓取最长的符合规则的字符串,所以从第一个<直接匹配到了最后一个>,才得到了那个包含多余内容的结果。咱们有两种简单的方法可以解决这个问题,轻松提取每个<>里的内容:
方法一:使用非贪婪匹配模式
把正则里的.*改成.*?,加上问号后就会变成非贪婪匹配,匹配到第一个>就会停止。再用re.findall()一次性获取所有匹配到的分组内容:
import re str = "Please use <cmd> and after that <cmd2>!" # 非贪婪匹配:匹配到第一个>就停止 results = re.findall('<(.*?)>', str) print(results) # 输出: ['cmd', 'cmd2']
方法二:使用排除型字符集
另一种更高效的方式是用[^>]+,这个表达式的意思是匹配任意不是>的字符,完美避开贪婪匹配的问题:
import re str = "Please use <cmd> and after that <cmd2>!" # 匹配除>之外的所有字符,精准锁定<>内的内容 results = re.findall('<([^>]+)>', str) print(results) # 输出: ['cmd', 'cmd2']
如果之后你只想单独获取第一个或者第二个匹配项,也可以通过索引访问结果列表,比如results[0]拿到cmd,results[1]拿到cmd2。
内容的提问来源于stack exchange,提问作者Chronuak
相关产品推荐
相关产品推荐

