如何在HuggingFace复刻Common Voice v11的「视图」功能?
配置HuggingFace数据集视图实现多语言与数据类型筛选
要实现你需要的视图功能,核心是先定义好数据集的关键字段,再配置视图规则,具体操作如下:
一、先规范数据集的字段定义
你的数据按语言存放在train/test/validate文件夹中,需要先在数据集加载脚本(通常是dataset.py)里给每条数据补充两个核心字段:
language:标记数据所属的语言(比如"中文"、"英文"或对应代码如"zh-CN")split:标记数据类型(固定为"train"/"test"/"validate")
同时要确保每条数据都包含client_id、audio(对应mp3文件路径)、sentence(读取对应txt的转录内容)这三个特征。
二、配置视图的筛选器与展示列
有两种配置方式,选顺手的操作即可:
方式1:网页可视化配置(更直观)
- 打开你的数据集主页,点击右上角的Settings
- 找到Dataset viewer板块,点击Configure viewer
- 添加筛选器:
- 第一个筛选器选择
language字段,类型设为下拉列表(Dropdown),系统会自动读取数据中的所有语言选项 - 第二个筛选器选择
split字段,同样设为下拉列表,选项固定为"train"、"test"、"validate"
- 第一个筛选器选择
- 设置展示列:在Columns to display中勾选
client_id、audio、sentence,调整顺序后保存
方式2:通过README.md元数据配置
在数据集的README.md开头添加一段YAML配置,HuggingFace会自动识别并应用:
--- dataset_info: features: - name: client_id dtype: string - name: audio dtype: audio - name: sentence dtype: string - name: language dtype: string - name: split dtype: string viewer: type: table columns: ["client_id", "audio", "sentence"] filters: - column: language type: dropdown - column: split type: dropdown ---
三、验证配置效果
完成配置后回到数据集的Viewer页面,就能看到:
- 顶部出现语言和数据类型的下拉筛选器
- 表格仅展示你指定的三列,音频列会自动生成播放控件
内容的提问来源于stack exchange,提问作者Michel Mesquita
相关产品推荐
相关产品推荐

