循环中使用sed -i无法更新.fam文件的问题排查
批量更新plink .fam文件分组:循环中sed失效的原因与解决办法
场景与问题
需要批量更新plink格式的File1.fam文件:文件每行格式为pop id 0 0 0 -9,当前pop与id值相同;另有File2.txt记录每个样本的正确分组,每行是id pop对应关系。
尝试用while循环结合sed批量替换,但命令执行后目标文件无任何修改,单独执行sed命令却能正常生效。
相关文件格式
- File1.fam(目标文件):
pop id 0 0 0 -9 pop id 0 0 0 -9 pop id 0 0 0 -9
- File2.txt(映射文件):每行包含样本ID和对应分组,格式示例:
sample1 groupA sample2 groupB sample3 groupA
出错的循环命令
while read -r id pop; do sed -i 's/^$id/$pop/' File1.fam; done < File2.txt
失效原因
核心问题是单引号的变量解析限制:bash中,单引号包裹的内容会被当作纯字面量,$id和$pop不会被解析为循环中的变量值,sed实际执行的是匹配^$id这样的固定字符串,而不是对应样本的ID,自然找不到匹配项,也就不会修改文件。
另外,这个循环会对File1.fam执行700次读写操作,大文件下效率极低。
解决办法
方案1:修改sed的引号类型
把sed命令的单引号改为双引号,让bash正常解析变量:
while read -r id pop; do sed -i "s/^$id/$pop/" File1.fam; done < File2.txt
⚠️ 注意:如果ID或分组名中包含/、&等sed特殊字符,这个命令会报错,需要提前对特殊字符转义。
方案2:用awk一次性处理(推荐)
awk只需读取两次文件(一次映射文件、一次目标文件),效率远高于循环调用sed,还能规避特殊字符问题:
awk 'NR==FNR{map[$1]=$2; next} {if ($2 in map) $1=map[$2]; print}' File2.txt File1.fam > temp.fam && mv temp.fam File1.fam
命令解释:
NR==FNR:处理第一个输入文件File2.txt时,将ID作为键、分组作为值存入map数组;- 处理第二个输入文件
File1.fam时,检查第二列(样本ID)是否存在于map中,若存在则将第一列(原分组)替换为对应的map值; - 输出到临时文件后覆盖原文件,避免直接修改原文件导致数据损坏。
内容的提问来源于stack exchange,提问作者Pedro Morell
相关产品推荐
相关产品推荐

