Nextflow DSL2:如何按染色体文件名片段合并多进程输出至另一进程
解决方案
要实现按染色体将进程A的VCF文件与进程B的每个BED文件配对,传给进程C,需要通过为输出添加染色体标识、展开B的多文件输出、按染色体关联两个通道这几个步骤完成:
1. 修改进程A的输出,携带染色体标识
修改A的output,将提取到的染色体编号作为元组的第一个元素,方便后续基于标识匹配:
process A { module "bcftools/1.16" publishDir "${params.out_dir}", mode: 'copy', overwrite: true input: path vcf path tbi output: // 输出(染色体编号, VCF文件)的元组 tuple val(chr), path("${chr}_qc.vcf.gz") script: def chr = (vcf =~ /chr\d{1,2}/)[0] """ bcftools view -R ${params.sites_list} -Oz -o ${chr}_qc.vcf.gz ${vcf} tabix -f ${chr}_qc.vcf.gz """ }
2. 修改进程B的输出,携带染色体标识并展开多文件
B的输出是每个染色体对应多个BED文件,先提取染色体编号,再通过flatMap将每个染色体的BED列表拆分为单个BED条目,保留染色体标识:
process B { publishDir "${params.out_dir}", mode: 'copy', overwrite: true input: path(vcf) output: // 输出(染色体编号, BED文件列表)的元组 tuple val(chr), path("${chr}.*.bed") script: def chr = (vcf =~ /chr\d{1,2}/)[0] """ python split_chr.py ${params.chr_lims} ${vcf} """ } // 处理B的输出:将每个染色体的BED列表拆分为单个BED,保留染色体标识 def B_flat = B.out.flatMap { chr, beds -> beds.collect { bed -> [chr, bed] } }
3. 按染色体关联A和B的输出,并传给进程C
使用Nextflow的join操作,基于染色体编号关联A的输出和处理后的B的输出,最终得到每个VCF与对应染色体单个BED的配对,再传给C:
workflow { A(someprocess.out) B(A.out) // 按染色体关联A和展开后的B输出,得到[chr, vcf, bed]格式的元组 def combined_AB = A.out.join(B_flat) // 仅传递vcf和bed给进程C C(combined_AB.map { chr, vcf, bed -> [vcf, bed] }) }
最终效果
处理后传给C的输入通道格式完全符合需求:
[ /path/chr1_qc.vcf.gz, /path/chr1.a.bed ] [ /path/chr1_qc.vcf.gz, /path/chr1.b.bed ] [ /path/chr2_qc.vcf.gz, /path/chr2.a.bed ] [ /path/chr2_qc.vcf.gz, /path/chr2.b.bed ]
内容的提问来源于stack exchange,提问作者Vickie
相关产品推荐
相关产品推荐

