如何用Python提取XML文件中sequence标签内的氨基酸序列
提取XML解析结果中FASTA格式的纯氨基酸序列
你可以通过以下几种纯Python方法提取连续的氨基酸序列,无需额外依赖:
方法一:按行分割处理
先将FASTA文本按换行拆分成行列表,跳过开头的标题行,再拼接剩余行并去除所有空白字符:fasta_content = drug.find('sequences').find('sequence').text # 拆分文本为行 lines = fasta_content.splitlines() # 跳过标题行,拼接所有序列行并清除空白 pure_sequence = ''.join(line.strip() for line in lines[1:])方法二:定位换行符截取内容
找到第一个换行符的位置,截取后续内容后清除所有空白:fasta_content = drug.find('sequences').find('sequence').text # 截取第一个换行后的所有内容 sequence_part = fasta_content[fasta_content.find('\n') + 1:] # 清除所有空白(换行、空格等) pure_sequence = ''.join(sequence_part.split())
如果处理大量FASTA格式内容或需要更健壮的解析,推荐使用BioPython库:
from Bio import SeqIO from io import StringIO fasta_content = drug.find('sequences').find('sequence').text # 将文本转为类文件对象供SeqIO解析 seq_record = next(SeqIO.parse(StringIO(fasta_content), 'fasta')) pure_sequence = str(seq_record.seq)
使用前需要先安装BioPython:pip install biopython
内容的提问来源于stack exchange,提问作者Orca
相关产品推荐
相关产品推荐

