You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python正则表达式:移除特定字符至大写字母前的子串(保留字母)

Python正则表达式实现移除指定内容的正确方案

需求明确:移除\r\n之后到第一个大写字母[A-Z]之前的所有内容,保留该大写字母开头的子串。比如要删掉输入里的Processing及后续任意数量的点,只留后面大写字母开头的部分。

原正则的问题

你之前用的(?s)\\r\\n.*?\.[A-Z][^\w\s]会误删目标大写字母,原因是这个表达式把大写字母也纳入了匹配范围,而且末尾的[^\w\s]还额外限制了匹配逻辑,不符合需求。

正确实现方案

使用正向预查定位第一个大写字母,确保匹配范围截止到大写字母之前,不会包含目标字母。对应的正则表达式为:

r'\r\n.*?(?=[A-Z])'

代码示例

import re

# 示例输入文本
input_content = """hello world\r\n Processing ....Pass
hello world\r\n Processing .Fail
hello world\r\n Processing ......Error
hello world\r\n Processing ..Fail
hello world\r\n Processing .......Any string"""

# 正则替换
cleaned_content = re.sub(r'\r\n.*?(?=[A-Z])', '\r\n ', input_content)

print(cleaned_content)

正则逻辑解释

  • \r\n:精准匹配换行符
  • .*?:非贪婪模式匹配任意字符(避免匹配到后续的大写字母)
  • (?=[A-Z]):正向预查,仅当后续字符是大写字母时停止匹配,且该大写字母不会被纳入匹配内容,替换时自然保留。

运行后输出符合预期:

hello world\r\n Pass
hello world\r\n Fail
hello world\r\n Error
hello world\r\n Fail
hello world\r\n Any string

内容的提问来源于stack exchange,提问作者HV92436

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 09:36:10