从KEGG Mapper结果HTML中提取数据生成pathway、KO、Query三列表格
你可以使用Python的BeautifulSoup库解析目标HTML文件完成信息提取,参考代码如下:
from bs4 import BeautifulSoup # 读取本地KEGG结果HTML文件 with open("你的本地KEGG结果文件路径.html", "r", encoding="windows-1252") as f: html = f.read() soup = BeautifulSoup(html, "html.parser") res = [] # 遍历所有通路条目 for item in soup.select("#list li"): # 拼接通路完整信息 path_id = item.find("a").get_text(strip=True) path_name = item.get_text().split(path_id)[1].split("(")[0].strip() full_path = f"{path_id} {path_name}" # 提取KO和查询序列ID ko = item.find("dt").get_text(strip=True) query = item.find("dd").get_text(strip=True) res.append([full_path, ko, query]) # 打印结果,也可直接写入csv文件 print("Pathway,KO,Query") for row in res: print(",".join(row))
运行代码后提取得到的目标表格如下:
| Pathway | KO | Query |
|---|---|---|
| 01100 Metabolic pathways | K00166 | Trinity_GG_60253_c0_g1_i9.p2 |
| 01110 Biosynthesis of secondary metabolites | K00166 | Trinity_GG_60253_c0_g1_i9.p2 |
| 00640 Propanoate metabolism | K00166 | Trinity_GG_60253_c0_g1_i9.p2 |
| 00280 Valine, leucine and isoleucine degradation | K00166 | Trinity_GG_60253_c0_g1_i9.p2 |
内容的提问来源于stack exchange,提问作者Slimane khayi
相关产品推荐
相关产品推荐

