You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在HuggingFace复刻Common Voice v11的「视图」功能?

配置HuggingFace数据集视图实现多语言与数据类型筛选

要实现你需要的视图功能,核心是先定义好数据集的关键字段,再配置视图规则,具体操作如下:

一、先规范数据集的字段定义

你的数据按语言存放在train/test/validate文件夹中,需要先在数据集加载脚本(通常是dataset.py)里给每条数据补充两个核心字段:

  • language:标记数据所属的语言(比如"中文"、"英文"或对应代码如"zh-CN")
  • split:标记数据类型(固定为"train"/"test"/"validate")
    同时要确保每条数据都包含client_id、audio(对应mp3文件路径)、sentence(读取对应txt的转录内容)这三个特征。

二、配置视图的筛选器与展示列

有两种配置方式,选顺手的操作即可:

方式1:网页可视化配置(更直观)

  1. 打开你的数据集主页,点击右上角的Settings
  2. 找到Dataset viewer板块,点击Configure viewer
  3. 添加筛选器:
    • 第一个筛选器选择language字段,类型设为下拉列表(Dropdown),系统会自动读取数据中的所有语言选项
    • 第二个筛选器选择split字段,同样设为下拉列表,选项固定为"train"、"test"、"validate"
  4. 设置展示列:在Columns to display中勾选client_id、audio、sentence,调整顺序后保存

方式2:通过README.md元数据配置

在数据集的README.md开头添加一段YAML配置,HuggingFace会自动识别并应用:

---
dataset_info:
  features:
    - name: client_id
      dtype: string
    - name: audio
      dtype: audio
    - name: sentence
      dtype: string
    - name: language
      dtype: string
    - name: split
      dtype: string
  viewer:
    type: table
    columns: ["client_id", "audio", "sentence"]
    filters:
      - column: language
        type: dropdown
      - column: split
        type: dropdown
---

三、验证配置效果

完成配置后回到数据集的Viewer页面,就能看到:

  • 顶部出现语言和数据类型的下拉筛选器
  • 表格仅展示你指定的三列,音频列会自动生成播放控件

内容的提问来源于stack exchange,提问作者Michel Mesquita

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 08:57:13