如何将HTML表格解析为可移植数据集(DSV、JSON等)
提取维基百科表格数据到DSV/JSON的方案
无编程快速方案
- 打开目标页面后,右键目标表格,选择「检查」进入开发者工具
- 在Elements面板定位到
<table>标签,右键选择「复制」→「复制表格」 - 粘贴到Excel/Google Sheets,再通过软件的「导出」功能保存为CSV(DSV格式)或JSON
编程自动化方案(Python)
用pandas直接解析HTML表格,无需手写复杂XPath:
import pandas as pd # 加载目标维基百科页面的表格集合 url = "https://en.wikipedia.org/wiki/List_of_Solar_System_objects_by_size#Objects_with_radius_over_400_km" tables = pd.read_html(url) # 定位目标表格(需根据页面实际结构调整索引,通常是第1或第2个表格) target_table = tables[1] # 导出为CSV(DSV的常用格式) target_table.to_csv("solar_objects.csv", index=False) # 导出为JSON(按记录格式) target_table.to_json("solar_objects.json", orient="records")
pandas会自动处理HTML的不规则结构,比XPath更适配HTML表格的解析需求。
内容的提问来源于stack exchange,提问作者Reilas
相关产品推荐
相关产品推荐

