You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python提取XML文件中sequence标签内的氨基酸序列

提取XML解析结果中FASTA格式的纯氨基酸序列

你可以通过以下几种纯Python方法提取连续的氨基酸序列,无需额外依赖:

  • 方法一:按行分割处理
    先将FASTA文本按换行拆分成行列表,跳过开头的标题行,再拼接剩余行并去除所有空白字符:

    fasta_content = drug.find('sequences').find('sequence').text
    # 拆分文本为行
    lines = fasta_content.splitlines()
    # 跳过标题行,拼接所有序列行并清除空白
    pure_sequence = ''.join(line.strip() for line in lines[1:])
    
  • 方法二:定位换行符截取内容
    找到第一个换行符的位置,截取后续内容后清除所有空白:

    fasta_content = drug.find('sequences').find('sequence').text
    # 截取第一个换行后的所有内容
    sequence_part = fasta_content[fasta_content.find('\n') + 1:]
    # 清除所有空白(换行、空格等)
    pure_sequence = ''.join(sequence_part.split())
    

如果处理大量FASTA格式内容或需要更健壮的解析,推荐使用BioPython库:

from Bio import SeqIO
from io import StringIO

fasta_content = drug.find('sequences').find('sequence').text
# 将文本转为类文件对象供SeqIO解析
seq_record = next(SeqIO.parse(StringIO(fasta_content), 'fasta'))
pure_sequence = str(seq_record.seq)

使用前需要先安装BioPython:pip install biopython

内容的提问来源于stack exchange,提问作者Orca

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.13 15:42:52