You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Jupyter中将Hugging Face数据集转为Pandas DataFrame

将Hugging Face Dataset转为Pandas DataFrame以便查看和操作

问题场景

已安装Hugging Face datasets库,可在Jupyter环境中成功下载papluca/language-identification数据集,得到DatasetDict或指定split后的Dataset对象,但无法直接便捷查看数据,希望转为Pandas DataFrame以使用df.head()等常规数据操作。

解决方案

核心是调用Dataset对象的.to_pandas()内置方法,分两种场景处理:

  • 若拿到的是DatasetDict:先指定具体split(如train/test)得到单个Dataset对象,再调用.to_pandas()
  • 若已获取指定split后的Dataset对象:直接调用.to_pandas()即可

代码示例

方式1:先加载DatasetDict再转换

from datasets import load_dataset

# 加载数据集得到DatasetDict
dataset = load_dataset("papluca/language-identification")

# 提取指定split的Dataset并转为DataFrame
train_df = dataset["train"].to_pandas()
# 查看前5条数据
train_df.head()

方式2:直接加载指定split并转换

from datasets import load_dataset

# 一步完成:加载指定split的Dataset并转为DataFrame
test_df = load_dataset("papluca/language-identification", split="test").to_pandas()
# 执行常规Pandas操作
test_df.describe()

说明

.to_pandas()是datasets库为Dataset对象提供的原生方法,转换后的DataFrame完整保留原数据集的字段和数据,可直接使用所有Pandas数据处理、分析方法。

内容的提问来源于stack exchange,提问作者carousallie

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 09:04:51