You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python正则匹配问题:如何排除带第二个小数点的SMC格式内容

Python文本筛选:精准匹配指定格式的SMC行

问题分析

你当前的正则SMC\s\d{1,3}\.\d{1,3}会误匹配带多个小数点的内容(如SMC 14.08.040),原因是它仅匹配了目标格式的前半段(比如SMC 14.08),没有限制该模式后续不能出现额外的小数点和数字。

解决方案

修改正则表达式,通过负向先行断言排除后续存在小数点+数字的情况,或者明确限定匹配模式的结束边界。以下是两种可靠写法:

写法1:负向先行断言

用(?!\.\d)确保匹配到目标格式后,后面不会紧接着小数点和数字,彻底排除多小数点的误匹配:

import re

with open("caosDump.txt", 'r', encoding="cp1252") as inp, open("newCaosDump.txt", 'w') as output:
    for line in inp:
        # 匹配SMC+空格+1-3位数字+小数点+1-3位数字,且后面不跟小数点+数字
        if re.search(r'SMC\s\d{1,3}\.\d{1,3}(?!\.\d)', line):
            output.write(line)

写法2:限定结束边界

如果目标格式的内容后面要么是空格,要么是行尾,可以用(?:\s|$)来限定:

import re

with open("caosDump.txt", 'r', encoding="cp1252") as inp, open("newCaosDump.txt", 'w') as output:
    for line in inp:
        # 匹配SMC+空格+1-3位数字+小数点+1-3位数字,且后面是空格或行尾
        if re.search(r'SMC\s\d{1,3}\.\d{1,3}(?:\s|$)', line):
            output.write(line)

为什么之前的方法无效?

  • 添加^和$会要求整行完全匹配目标格式,但实际行中可能还有其他内容,所以导致代码失效;
  • 单纯用单词边界\b效果不好,因为小数点不属于单词字符,\d{1,3}\b无法阻止后面紧跟小数点的情况。

内容的提问来源于stack exchange,提问作者AsianScooter

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 15:04:57