You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用pandas.read_csv读取CSV文件出现tokenizing错误该如何解决?

问题根因

你使用的是GitHub的网页预览地址(blob路径),返回的实际是HTML内容而非纯CSV文件,pandas按CSV规则解析时完全匹配不到正确的字段分隔逻辑,才会出现字段数不匹配的报错,这也是你修改sep参数无效的核心原因。

解决方法
  • 替换为GitHub Raw格式的URL
    将原URL中的blob字段替换为raw即可直接获取纯CSV内容,修改后的代码如下:
import pandas as pd
df = pd.read_csv('https://github.com/owid/covid-19-data/raw/master/public/data/vaccinations/vaccinations.csv')
data = df.head()
  • 通用异常行处理方案(当前场景不需要,仅作拓展)
    如果后续遇到合法CSV文件存在部分行格式错误的情况,可以添加on_bad_lines参数跳过异常行:
df = pd.read_csv('csv文件路径', on_bad_lines='skip')

内容的提问来源于stack exchange,提问作者Frank

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 23:45:01