使用parse_dates和index_col创建DataFrame时遭遇URLError报错求助
问题解决:URLError 读取GitHub CSV文件失败
问题根源
你使用的是GitHub文件的网页展示链接(blob路径),而非CSV文件的原始数据链接。pd.read_csv()只能直接读取纯文本格式的数据源,无法解析GitHub的网页HTML内容,因此抛出URLError。
解决方案
获取正确的原始CSV链接:
打开GitHub上的cardioActivities.csv文件页面,点击右上角的「Raw」按钮,复制弹出的纯文本链接。该文件的正确链接为:https://raw.githubusercontent.com/jbandzo/IBM-DATA-SCIENCE/main/cardioActivities.csv修改代码并添加目标参数:
将链接替换为原始链接,同时加入parse_dates和index_col参数(假设日期列名为Date,可根据实际列名调整)。修改后的代码如下:
import pandas as pd # 替换为原始CSV文件链接 runkeeper_file = 'https://raw.githubusercontent.com/jbandzo/IBM-DATA-SCIENCE/main/cardioActivities.csv' # 添加parse_dates和index_col参数解析日期并设为索引 df = pd.read_csv(runkeeper_file, parse_dates=['Date'], index_col='Date') # 查看随机3行数据 display(df.sample(3)) # 查看数据结构信息 display(df.info())
额外说明
parse_dates=['Date']:告诉pandas将Date列解析为datetime格式index_col='Date':将解析后的日期列设为DataFrame的索引- 若日期列名不是
Date,可通过先读取少量数据(如df.head())确认列名后调整参数
内容的提问来源于stack exchange,提问作者Joaky
相关产品推荐
相关产品推荐

