使用sed为FASTA头行首尾加词时出现换行与尾M字符问题如何解决
问题原因说明
- 行尾多余的M字符是Windows/DOS格式换行符导致的:你的原始FASTA文件是Windows环境生成/编辑过的,换行符为
\r\n(回车+换行),而Linux/macOS下的sed默认以\n作为行分隔符,会将行尾的\r识别为普通文本保留,显示出来就是^M(即你观察到的M字符)。 - Finalword换行是
\r被捕获进正则分组导致的:头行末尾的\r被你的正则^>(.*)捕获到分组\1中,替换后的内容变为>Initialword/A_1000\r/Finalword,\r会让光标复位到当前行首,后续的/Finalword就会被渲染到下一行,产生换行的假象。 - 额外的正则写法问题:默认sed使用基础正则表达式(BRE),
(和)是普通匹配字符,需要加反斜杠转义才能作为捕获组使用,你原命令中的括号没有转义,匹配逻辑本身也存在错误。
修正后的执行命令
不需要额外转换工具,单条sed命令即可完成需求,生成目标output.fasta:
sed 's/\r$//; s%^>\(.*\)%>Initialword/\1/Finalword%' input.fasta > output.fasta
如果习惯使用扩展正则写法,可以加-E参数省略括号的转义:
sed -E 's/\r$//; s%^>(.*)%>Initialword/\1/Finalword%' input.fasta > output.fasta
如果要直接修改原文件,可以加-i参数(GNU sed适用),同时会自动生成原文件备份input.fasta.bak避免误操作:
sed -i.bak 's/\r$//; s%^>\(.*\)%>Initialword/\1/Finalword%' input.fasta
内容的提问来源于stack exchange,提问作者Keah Chambers
相关产品推荐
相关产品推荐

