如何从KEGG数据库下载数据?是否有现成库可用于KEGG数据提取?
KEGG数据提取常用工具及使用指引
Python生态工具
- Biopython内置
Bio.KEGG.REST模块:无需自行开发爬虫,可直接调用KEGG官方公开接口查询通路、基因、化合物、反应等各类实体数据,轻量易用。简单示例如下:
from Bio.KEGG import REST # 提取人类糖酵解通路(ID: hsa00010)的完整注释信息 glycolysis_data = REST.kegg_get("hsa00010").read()
- PyKEGG:专门面向KEGG数据提取开发的第三方库,支持查询结果本地缓存、批量ID映射、通路结构解析等进阶功能,适合大规模数据集提取场景。
R生态工具
- KEGGREST:Bioconductor官方维护的KEGG接口包,是R领域最常用的KEGG数据提取工具,完整覆盖KEGG REST API的所有功能,示例代码如下:
library(KEGGREST) # 获取人类物种所有KEGG通路的ID与名称映射表 hsa_pathway_list <- keggList("pathway", "hsa") # 提取指定通路的关联基因、化合物、注释等全量信息 pathway_detail <- keggGet("hsa00010")
- clusterProfiler:如果你的研究后续需要做通路富集分析,该包内置了KEGG数据拉取功能,可直接关联你的基因/代谢物数据集完成后续分析,无需额外做数据格式转换。
使用提示
KEGG官方对公共API的请求频率有明确限制,批量提取数据时建议在两次请求之间增加1~2秒的间隔,避免IP被临时封禁。如果需要全量KEGG数据,也可以直接下载KEGG公开的FTP数据集做本地解析,提取效率更高。
内容的提问来源于stack exchange,提问作者Akash Kumar
相关产品推荐
相关产品推荐

