如何使用bash删除指定行的特定子串以修改FASTA文件头行信息
问题原因
你编写的awk命令没有区分序列头行和序列内容行,对所有行都统一执行了按|拆分后拼接4个字段的逻辑。而序列内容行中不存在|分隔符,拆分后$2、$3、$4均为空值,拼接后就会在末尾多出|||。
修正后的命令
awk -F '|' '/^>/{print $1 "|Chain " substr($2,8,1) "|" $3 "|" $4; next}1' sample
逻辑说明
- 用
/^>/匹配所有以>开头的序列头行,仅对这类行执行修改操作 substr($2,8,1)直接提取第二个字段第8位的首个链字母,比你之前的两次substr拼接写法更简洁next表示处理完头行后直接跳转处理下一行,不执行后续逻辑- 末尾的
1是awk的固定简写用法,代表直接原样输出所有未被前面逻辑处理的序列内容行,不会新增任何多余字符
运行上述命令即可得到你预期的输出结果。
内容的提问来源于stack exchange,提问作者Caterina
相关产品推荐
相关产品推荐

