Google Colab中上传150MB CSV数据集持续失败求助
解决Google Colab上传150MB CSV数据集失败的问题
我之前在Colab上传大文件时也踩过类似的坑,给你几个亲测有效的解决方案,按优先级试试:
优先用Google Drive挂载代替直接上传
Colab的直接上传功能对大文件支持不太友好,挂载Drive是更稳定的方式:- 运行下面的代码块授权挂载你的Google Drive:
from google.colab import drive drive.mount('/content/drive') - 挂载完成后,直接从Drive路径读取你的CSV即可:
import pandas as pd df = pd.read_csv('/content/drive/MyDrive/你的数据集存放路径/文件名.csv')
这种方式不仅能避免上传超时,后续还能重复使用数据集,不用每次都传。
- 运行下面的代码块授权挂载你的Google Drive:
检查网络和会话状态
- 上传大文件时网络不稳定很容易中断,建议切换到有线网络或者信号好的WiFi,同时关掉后台下载、视频这类占带宽的应用。
- 可以试试重启Colab会话(点击菜单栏「Runtime」→「Restart runtime」),有时候会话缓存出问题也会导致上传失败。
拆分数据集(临时应急方案)
如果暂时没法用Drive,可以把150MB的CSV拆成几个小文件上传,之后再合并:
本地拆分文件的Python示例(在本地运行):import pandas as pd # 按行数拆分,可根据需求调整chunk_size chunk_size = 50000 for idx, chunk in enumerate(pd.read_csv('你的原文件.csv', chunksize=chunk_size)): chunk.to_csv(f'拆分后的文件_{idx}.csv', index=False)上传所有拆分文件后,在Colab里合并:
import pandas as pd import glob # 获取所有拆分文件的路径 split_files = glob.glob('/content/拆分后的文件_*.csv') # 合并成完整数据集 full_df = pd.concat([pd.read_csv(file) for file in split_files], ignore_index=True)校验本地文件完整性
有时候本地文件损坏也会导致上传失败,可以检查一下文件的MD5哈希值,确认文件没有被损坏。
内容的提问来源于stack exchange,提问作者員建新
相关产品推荐
相关产品推荐

