如何从Kaggle Notebook直接创建公开数据集?
将Kaggle Notebook生成的CSV转为公开数据集的方法
先给你说清楚:Kaggle API绝对不是唯一办法,有两种实用路径,看你习惯哪种:
方法一:手动操作(不用碰API)
这是最省心的方式,适合不想折腾代码的情况:
- 跑完Notebook后,点页面左侧的「Files」面板,找到/kaggle/working里你生成的CSV文件
- 勾选目标文件,点面板顶部的「Download」把文件存到本地
- 打开Kaggle官网,进「Datasets」页面,点右上角「New Dataset」
- 跟着页面提示上传本地的CSV,填好数据集名称、描述、标签这些信息,最后设成「Public」发布就行
方法二:用Kaggle API(Notebook内直接完成)
如果想在Notebook里直接搞定发布,API确实能用,给你简化到最基础的步骤,不用纠结复杂参数:
- 先去Kaggle个人账号的「Account」页面,生成并下载API密钥文件(kaggle.json)
- 在Notebook里执行下面的代码配置API:
!pip install kaggle # 把下载的kaggle.json上传到Notebook的/files目录后,执行这几行 !mkdir -p ~/.kaggle !cp /kaggle/files/kaggle.json ~/.kaggle/ !chmod 600 ~/.kaggle/kaggle.json - 生成一个数据集元数据文件(dataset-metadata.json),内容大概这样:
{ "title": "CMC 24h Gainers Historical Data", "id": "你的Kaggle用户名/自定义数据集名称", "licenses": [{"name": "CC0-1.0"}] } - 把CSV文件和这个元数据文件都放到/kaggle/working目录,然后执行发布命令:
跑完这个命令,Kaggle就会自动帮你生成公开数据集!kaggle datasets create -p /kaggle/working --public
要是你之后想更新已有的公开数据集,把命令改成!kaggle datasets version -p /kaggle/working -m "本次更新说明" --no-archive,就能在现有数据集上追加新版本。
内容的提问来源于stack exchange,提问作者AyFait Jr.
相关产品推荐
相关产品推荐

