You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python正则提取异常:与Regexr结果不符,如何匹配至首个目标词?

匹配年份到首个vehicles之间内容的正则修改方案

原正则中的.+是贪婪匹配模式,会尽可能匹配最长的符合规则的内容,因此当文本里存在多个vehicles时,它会匹配到最后一个vehicles之前的全部内容,导致提取结果不符合预期。

只需要将贪婪匹配的.+替换为非贪婪匹配的.+?,即可让正则仅匹配到第一个vehicles为止。

修改后的正则表达式:

(?<=[1-2][0-9]{3}\s)(.+?)(?=\svehicles)

对应的pandas提取代码:

df['newcol'] = df['colA'].str.extract(r'(?<=[1-2][0-9]{3}\s)(.+?)(?=\svehicles)', expand=False)

内容的提问来源于stack exchange,提问作者Sid_J

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 08:02:01