Snakemake scatter-gather报AmbiguousRuleException问题求助
解决Snakemake scatter-gather的AmbiguousRuleException问题
核心原因
你遇到的歧义问题,本质是fastq_to_fasta和split两个规则的输出文件通配符模式完全重叠,导致Snakemake无法判断应该用哪个规则生成目标文件data/trimmed/Ornek_411-of-81-of-81-of-81-of-81-of-81-of-81-of-81-of-81-of-8.fasta。
具体排查与解决步骤
1. 严格区分两个规则的输出命名格式
最根本的解决方法是让两个规则的输出文件名结构完全不重叠:
- 给
split生成的分片文件加专属标识(比如_split后缀),避免和fastq_to_fasta的输出混淆:
这样分片文件会变成rule fastq_to_fasta: input: "data/raw/{sample}.fastq" output: "data/trimmed/{sample}.fasta" shell: "seqtk seq -A {input} > {output}" rule split: input: "data/trimmed/{sample}.fasta" output: "data/trimmed/{sample}_split-{chunk}.fasta" shell: "split -l 1000 {input} {output}_split-"Ornek_411_split-1.fasta这类格式,和原fasta文件彻底区分开。
2. 用正则约束通配符(适合无法改命名的场景)
如果必须保留现有命名格式,给规则的通配符加上正则表达式,明确限定匹配范围:
- 给
fastq_to_fasta的sample通配符约束:只匹配不含-of-的字符串 - 给
split的chunk通配符约束:只匹配数字部分
这样Snakemake会根据文件名是否包含rule fastq_to_fasta: input: "data/raw/{sample, regex=r'[^-]+'}.fastq" output: "data/trimmed/{sample}.fasta" shell: "seqtk seq -A {input} > {output}" rule split: input: "data/trimmed/{sample}.fasta" output: "data/trimmed/{sample}-of-{chunk, regex=r'\\d+'}.fasta" shell: "split -l 1000 {input} {output}-of-"-of-数字的结构,精准匹配对应的规则。
3. 验证规则匹配逻辑
用以下命令测试目标文件的匹配情况,帮助定位问题:
snakemake --dry-run data/trimmed/Ornek_411-of-81-of-81-of-81-of-81-of-81-of-81-of-81-of-81-of-8.fasta
执行后会显示Snakemake尝试匹配的规则,你可以从中确认两个规则的通配符是否仍存在重叠。
4. 检查scatter-gather的配置
确保scatter阶段的目标文件严格指向split规则的输出,而不是错误地指向fastq_to_fasta的输出路径。比如scatter的参数应该指定分片文件的模式,而非原fasta文件的模式。
应急方案:调整规则优先级(不推荐)
如果以上方法都无法快速生效,可以给其中一个规则加上priority参数(数值越高优先级越高),强制Snakemake选择指定规则:
rule split: priority=2 input: "data/trimmed/{sample}.fasta" output: "data/trimmed/{sample}-of-{chunk}.fasta" shell: "split -l 1000 {input} {output}-of-"
注意:这只是临时 workaround,本质没有解决通配符重叠的问题,长期来看还是要从命名或正则约束入手。
内容的提问来源于stack exchange,提问作者sahin
相关产品推荐
相关产品推荐

