在Kaggle与Colab中读取数据集得到不同shape的问题排查
Kaggle与Colab读取同一数据集Shape差异的原因分析
数据集下载不完整:Colab中下载的
2019-Dec.csv可能因网络中断、存储空间不足或下载命令错误,只获取了部分数据。可以对比Colab中文件大小与Kaggle原始文件大小(原始文件约1.1GB),若差距明显,重新完整下载。读取参数设置错误:
- 读取时可能误加了
nrows参数限制行数,比如执行了pd.read_csv('2019-Dec.csv', nrows=71188),导致仅加载前71188行。 - 若设置了
on_bad_lines='skip'(或旧版的error_bad_lines=False),当文件存在格式错误时会跳过大量行,这种情况通常会有警告信息,可检查运行日志。
- 读取时可能误加了
文件混淆:确认Colab中读取的确实是
2019-Dec.csv,该数据集包含多个月份的文件,可能误加载了其他体积较小的文件,导致行数差异。解压步骤遗漏:使用Kaggle API在Colab下载数据集时,若下载的是压缩包,需执行解压命令(如
unzip 2019-Dec.zip),否则读取的是未解压的损坏文件,会导致行数异常。
内容的提问来源于stack exchange,提问作者KSp
相关产品推荐
相关产品推荐

