You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何移除文件中第二列与第四列前4字符重复的行?

用Awk快速解决文本行筛选需求

嘿,这个场景用Awk处理再合适不过了——它天生就是为这种按列操作的文本处理任务设计的,7000行的文件完全不在话下,跑起来飞快。

直接上核心命令,你把your_file.txt换成自己的实际文件名就行:

awk '!( ($2 ~ /^AATT/ && $4 ~ /^AATT/) || ($2 ~ /^CTAG/ && $4 ~ /^CTAG/) )' your_file.txt > filtered_file.txt

我给你拆解下这个命令的逻辑:

  • !(...):整体取反,意思是不满足括号里两种情况的行才会被保留下来
  • $2 ~ /^AATT/:匹配第二列以"AATT"开头的行(^符号表示字段的起始位置)
  • &&:逻辑“与”,只有当第二列和第四列都以"AATT"开头时,这个子条件才成立
  • ||:逻辑“或”,只要满足「双AATT开头」或者「双CTAG开头」其中一种情况,就会被排除
  • > filtered_file.txt:把筛选后的结果输出到新文件,建议不要直接覆盖原文件,先验证结果没问题再替换

如果你想直接修改原文件(记得先备份!),可以借助sponge工具(需要先安装moreutils包,比如Ubuntu下执行sudo apt install moreutils):

awk '!( ($2 ~ /^AATT/ && $4 ~ /^AATT/) || ($2 ~ /^CTAG/ && $4 ~ /^CTAG/) )' your_file.txt | sponge your_file.txt

要是你用的是Windows环境,也可以用PowerShell来实现:

Get-Content your_file.txt | Where-Object {
    -not ( 
        ($_ -split '\s+')[1] -match '^AATT' -and ($_ -split '\s+')[3] -match '^AATT' -or 
        ($_ -split '\s+')[1] -match '^CTAG' -and ($_ -split '\s+')[3] -match '^CTAG' 
    )
} | Set-Content filtered_file.txt

这里-split '\s+'是按任意空白字符分割每行内容,PowerShell的索引从0开始,所以[1]对应第二列,[3]对应第四列。

内容的提问来源于stack exchange,提问作者Josh

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 07:52:21