You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Nextflow DSL2:如何按染色体文件名片段合并多进程输出至另一进程

解决方案

要实现按染色体将进程A的VCF文件与进程B的每个BED文件配对,传给进程C,需要通过为输出添加染色体标识、展开B的多文件输出、按染色体关联两个通道这几个步骤完成:

1. 修改进程A的输出,携带染色体标识

修改A的output,将提取到的染色体编号作为元组的第一个元素,方便后续基于标识匹配:

process A {
  module "bcftools/1.16"
  publishDir "${params.out_dir}", mode: 'copy', overwrite: true
  input:
  path vcf
  path tbi

  output:
  // 输出(染色体编号, VCF文件)的元组
  tuple val(chr), path("${chr}_qc.vcf.gz")
 
  script:
  def chr = (vcf =~ /chr\d{1,2}/)[0]
  """
  bcftools view -R ${params.sites_list} -Oz -o ${chr}_qc.vcf.gz ${vcf}
  tabix -f ${chr}_qc.vcf.gz
  """
}

2. 修改进程B的输出,携带染色体标识并展开多文件

B的输出是每个染色体对应多个BED文件,先提取染色体编号,再通过flatMap将每个染色体的BED列表拆分为单个BED条目,保留染色体标识:

process B {
  publishDir "${params.out_dir}", mode: 'copy', overwrite: true
  input:
  path(vcf)

  output:
  // 输出(染色体编号, BED文件列表)的元组
  tuple val(chr), path("${chr}.*.bed")

  script:
  def chr = (vcf =~ /chr\d{1,2}/)[0]
  """
  python split_chr.py ${params.chr_lims} ${vcf}
  """
}

// 处理B的输出:将每个染色体的BED列表拆分为单个BED,保留染色体标识
def B_flat = B.out.flatMap { chr, beds ->
    beds.collect { bed -> [chr, bed] }
}

3. 按染色体关联A和B的输出,并传给进程C

使用Nextflow的join操作,基于染色体编号关联A的输出和处理后的B的输出,最终得到每个VCF与对应染色体单个BED的配对,再传给C:

workflow {
   A(someprocess.out)
   B(A.out)
   
   // 按染色体关联A和展开后的B输出,得到[chr, vcf, bed]格式的元组
   def combined_AB = A.out.join(B_flat)
   // 仅传递vcf和bed给进程C
   C(combined_AB.map { chr, vcf, bed -> [vcf, bed] })
}

最终效果

处理后传给C的输入通道格式完全符合需求:

[ /path/chr1_qc.vcf.gz, /path/chr1.a.bed ]
[ /path/chr1_qc.vcf.gz, /path/chr1.b.bed ]
[ /path/chr2_qc.vcf.gz, /path/chr2.a.bed ]
[ /path/chr2_qc.vcf.gz, /path/chr2.b.bed ]

内容的提问来源于stack exchange,提问作者Vickie

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.04 21:25:13