SED命令无法匹配首次匹配项的问题及修正咨询
问题分析
原命令sed -e ‘s/\(^.*D1:\)\(.*\)\(\|A4:.*$)/\2/’的核心问题是正则贪婪匹配:^.*D1:中的.*会尽可能匹配最长字符串,遇到多个D1:时,会匹配到最后一个D1:的位置而非第一个,最终提取内容不符合预期。
修改方案
方案1:使用非贪婪匹配(GNU sed 适用)
利用扩展正则的非贪婪量词.*?,让^.*?D1:仅匹配到第一个D1:为止,同时保留对A4:及后续内容的处理:
sed -r 's/^.*?(D1:)(.*)(A4:.*$)?/\2/'
-r:启用扩展正则表达式,支持非贪婪匹配^.*?(D1:):匹配开头到第一个D1:的所有内容(.*):提取D1:之后到A4:(如果存在)之前的内容(A4:.*$)?:可选匹配A4:及之后的内容,替换时舍弃这部分
方案2:不依赖非贪婪匹配(兼容所有sed版本)
如果你的sed不支持扩展正则,可通过限定匹配范围避免贪婪:
sed 's/^[^D]*D1:\(.*\)/\1/; s/A4:.*$//'
- 第一个替换
s/^[^D]*D1:\(.*\)/\1/:先匹配所有非D字符,遇到D后检查是否为D1:,确保只匹配到第一个D1:,保留后续内容 - 第二个替换
s/A4:.*$//:删除A4:及之后的所有内容(如果存在)
关键注意点
- 原命令中的中文单引号
‘’需替换为英文单引号'',否则shell会识别错误 - 若需求是提取
D1:之后的全部内容(不管是否有A4:),可简化为:sed -r 's/^.*?(D1:)(.*)/\2/'
内容的提问来源于stack exchange,提问作者Sri DS
相关产品推荐
相关产品推荐

