You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用GitHub数据集URL在Python读取CSV时遇ParserError的解决咨询

解决Pandas读取GitHub CSV文件时的ParserError问题

错误原因

  • 你用的是GitHub仓库的网页展示URL,不是原始CSV文件的直接链接,Pandas读取到的是HTML页面内容而非纯CSV数据,解析时自然会出现字段数不匹配的Error tokenizing data错误。
  • 代码里len(df, index_col=0)用法错误,len()函数不接受第二个参数,索引列应该在read_csv方法中指定。

修复步骤

  1. 替换为原始CSV文件URL
    将GitHub文件页面URL中的blob/main替换为raw/main,就能拿到原始数据的直接链接:
    原URL:https://github.com/noghte/datasets/blob/main/apartments.csv
    修正后URL:https://github.com/noghte/datasets/raw/main/apartments.csv

  2. 修正代码逻辑
    在pd.read_csv()中指定index_col参数,同时正确使用len()获取DataFrame的行数。

修正后的完整代码

import pandas as pd

url = "https://github.com/noghte/datasets/raw/main/apartments.csv"
df = pd.read_csv(url, index_col=0)
print(len(df))  # 输出DataFrame的行数
# 也可以用 df.shape[0] 获取行数

补充说明

GitHub的blob页面是带UI的HTML页面,包含导航栏、代码高亮等额外内容,并非纯CSV格式。只有通过raw链接才能获取到原始的CSV文本数据,Pandas才能正确解析。

内容的提问来源于stack exchange,提问作者outofthereality

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 17:10:27