使用pandas读取GitHub CSV文件报ParserError错误的解决方案咨询
GitHub存储CSV文件读取失败解决方案
报错原因
触发
ParserError的核心原因是你使用了GitHub的文件预览页地址,下载到的内容实际是HTML页面而非纯CSV文本,pandas按CSV规则解析时字段匹配失败触发报错。
解决方案
方案1:使用原始CSV文件读取(推荐)
GitHub的文件预览页路径含/blob/标识,将路径中的blob替换为raw即可获取纯CSV文件地址,无需手动下载到本地即可直接读取。也可以点击预览页右上角的Raw按钮,右键另存为CSV文件到本地后读取。
代码示例:
import pandas as pd # 替换blob为raw后的原始CSV地址,或本地存储的CSV文件路径 csv_path = "替换后的原始CSV地址/本地CSV文件路径" ref = pd.read_csv(csv_path).fillna(0) for _, line in ref.iterrows(): pid = line['pid'] cls = line.cls scan_id = line.scan_id is_seg = line.is_seg
方案2:直接解析已下载的HTML文件
如果你已经将HTML格式的预览页下载到本地,可直接用pandas的read_html函数解析页面中嵌入的表格:
import pandas as pd # 读取本地HTML文件,返回页面内所有表格的列表 table_list = pd.read_html("本地HTML文件路径") # 取第一个有效表格,删除预览页生成的空行号列 ref = table_list[0].drop(table_list[0].columns[0], axis=1).fillna(0) for _, line in ref.iterrows(): pid = line['pid'] cls = line.cls scan_id = line.scan_id is_seg = line.is_seg
内容的提问来源于stack exchange,提问作者Rawan
相关产品推荐
相关产品推荐

