如何在Jupyter中将Hugging Face数据集转为Pandas DataFrame
将Hugging Face Dataset转为Pandas DataFrame以便查看和操作
问题场景
已安装Hugging Face datasets库,可在Jupyter环境中成功下载papluca/language-identification数据集,得到DatasetDict或指定split后的Dataset对象,但无法直接便捷查看数据,希望转为Pandas DataFrame以使用df.head()等常规数据操作。
解决方案
核心是调用Dataset对象的.to_pandas()内置方法,分两种场景处理:
- 若拿到的是
DatasetDict:先指定具体split(如train/test)得到单个Dataset对象,再调用.to_pandas() - 若已获取指定split后的
Dataset对象:直接调用.to_pandas()即可
代码示例
方式1:先加载DatasetDict再转换
from datasets import load_dataset # 加载数据集得到DatasetDict dataset = load_dataset("papluca/language-identification") # 提取指定split的Dataset并转为DataFrame train_df = dataset["train"].to_pandas() # 查看前5条数据 train_df.head()
方式2:直接加载指定split并转换
from datasets import load_dataset # 一步完成:加载指定split的Dataset并转为DataFrame test_df = load_dataset("papluca/language-identification", split="test").to_pandas() # 执行常规Pandas操作 test_df.describe()
说明
.to_pandas()是datasets库为Dataset对象提供的原生方法,转换后的DataFrame完整保留原数据集的字段和数据,可直接使用所有Pandas数据处理、分析方法。
内容的提问来源于stack exchange,提问作者carousallie
相关产品推荐
相关产品推荐

