You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用sed压缩文本文件中重复出现的指定单词?

解决方案:压缩连续重复的多字符单元

你说得对,tr命令确实只能处理单个字符的重复(比如把多个连续空格缩成一个),没法搞定像;rfc1234这种多字符单元的连续重复。这里给你两个简单好用的方法:

方法1:用sed精准替换特定重复单元

如果你只需要针对;rfc1234这个特定内容做压缩,用sed的扩展正则表达式就能快速完成:

sed -E 's/(;rfc1234)\1+/\1/g' input.txt > output.txt
  • -E:启用扩展正则表达式,不用额外转义括号和+符号
  • (;rfc1234):把目标重复单元定义为一个捕获组
  • \1+:匹配这个捕获组连续出现1次以上的情况
  • \1:替换成单个捕获组内容
  • g:全局替换,处理文本里所有符合条件的重复片段

方法2:用awk处理所有连续重复单词

如果你的需求是所有连续重复的单词都要压缩成单个(不局限于;rfc1234),awk的逐词处理会更灵活:

awk '{
    prev = ""
    for(i=1; i<=NF; i++) {
        if($i != prev) {
            printf "%s ", $i
            prev = $i
        }
    }
    print ""
}' input.txt > output.txt
  • 遍历文本的每个字段(默认按空格分割单词)
  • 记录上一个输出的单词prev,只有当前单词和prev不同时才输出,避免重复
  • 最后用print ""补全换行,保证输出格式和原文本一致

用这两个方法处理你的输入文本:

this is the code ;rfc1234;rfc1234 this is the code ;rfc1234;rfc1234;rfc1234;rfc1234

都会得到你想要的结果:

this is the code ;rfc1234 this is the code ;rfc1234

内容的提问来源于stack exchange,提问作者sherpaurgen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.28 09:28:01