求助:基于hg38基因组DNA坐标获取位点上下游200bp mRNA序列
用UCSC Table Browser获取hg38坐标上下游200bp的mRNA序列
1. 基础参数配置
打开Table Browser后先固定核心参数:
- clade: Mammal
- genome: Human
- assembly: hg38
- group: Genes and Gene Predictions
- track: 选择你需要的mRNA注释集(比如RefSeq Genes、GENCODE,按需选)
- table: 对应track的mRNA表(比如RefSeq对应
refGene)
2. 关键:设置上下游200bp范围
在region区域做以下操作:
- 单个坐标:选
position,输入格式如chr1:123456-123456(单个位点的start和end设为相同值),然后找到**"flanking sequence"**选项,在upstream填200,downstream填200 - 批量坐标:把位点整理成
chr:start-end格式(每个位点的start/end一致)保存为纯文本文件,在region选uploaded list上传文件,同样在flanking sequence中设置上下游各200bp
3. 输出mRNA序列
点击get output后,在跳转页面选DNA sequence:
- 勾选**"Exonic sequences only"**,确保只提取对应mRNA的外显子序列(而非原始基因组DNA)
- 可选勾选
"Use strand",保证序列方向与mRNA正义链一致 - 按需调整其他参数(比如是否包含序列ID、坐标注释),最后点击
get sequence即可获取目标序列
补充批量处理方案
如果需要更高效的批量操作,可以先通过bedtools扩展坐标范围,再提取序列:
- 用bedtools生成扩展后的坐标:
bedtools flank -i your_coords.bed -g hg38.chrom.sizes -l 200 -r 200 > extended_coords.bed
- 提取对应mRNA序列:
fastaFromBed -fi hg38_refMrna.fa -bed extended_coords.bed -fo output.fa
内容的提问来源于stack exchange,提问作者user20649250
相关产品推荐
相关产品推荐

