Linux环境下如何按chr、bpos两列优先级排序数据文件
Linux下按指定列排序该类文件的最佳方案
直接使用Linux系统自带的sort命令即可,无额外依赖、处理速度快,是这类文本排序场景的最优选择,不需要编写自定义脚本或安装第三方工具。
你的数据文件示例如下:
需求为优先按第2列(chr字段)排序,同chr值的记录再按第3列(bpos字段)排序,可根据你的文件实际格式选对应命令:
- 常规场景(文件为空格/制表符分隔,仅需基础字典序+数值排序)
直接执行以下命令:
参数说明:sort -k2,2 -k3,3n 你的原始文件名 > 排序后的结果文件名-k2,2:指定第一排序关键字为第2列,明确限定范围为第2列本身,不会把后续列内容纳入第一关键字排序,避免干扰第二规则-k3,3n:指定第二排序关键字为第3列,末尾的n表示按数值模式排序,避免出现字典序下10排在2前面的错误
- 适配基因组文件的特殊场景(chr字段需要按生物信息学常规顺序排列,即chr1 < chr2 < ... < chr10 < ... < chr22 < chrX < chrY < chrM)
这时候把chr列的排序模式改成版本号排序即可,命令如下:
其中sort -k2,2V -k3,3n 你的原始文件名 > 排序后的结果文件名-V参数会自动识别字符串中的数字片段,按数值大小排序,完美解决chr10这类带多位数字的字段字典序错乱问题,是处理基因组坐标类文件的常用参数。
注意:写
-k参数时一定要加列范围限定(比如-k2,2而不是只写-k2),如果只写起始列号,sort会默认把从该列开始到行尾的所有内容都纳入当前排序关键字,会导致你设置的第二排序关键字失效。
内容的提问来源于stack exchange,提问作者Mahan
相关产品推荐
相关产品推荐

