使用pandas.read_csv读取CSV文件出现tokenizing错误该如何解决?
问题根因
你使用的是GitHub的网页预览地址(blob路径),返回的实际是HTML内容而非纯CSV文件,pandas按CSV规则解析时完全匹配不到正确的字段分隔逻辑,才会出现字段数不匹配的报错,这也是你修改sep参数无效的核心原因。
解决方法
- 替换为GitHub Raw格式的URL
将原URL中的blob字段替换为raw即可直接获取纯CSV内容,修改后的代码如下:
import pandas as pd df = pd.read_csv('https://github.com/owid/covid-19-data/raw/master/public/data/vaccinations/vaccinations.csv') data = df.head()
- 通用异常行处理方案(当前场景不需要,仅作拓展)
如果后续遇到合法CSV文件存在部分行格式错误的情况,可以添加on_bad_lines参数跳过异常行:
df = pd.read_csv('csv文件路径', on_bad_lines='skip')
内容的提问来源于stack exchange,提问作者Frank
相关产品推荐
相关产品推荐

