You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Common Voice数据训练丹麦语Wav2vec XLSR Transformer ASR模型时数据集拉取失败

解决datasets库拉取丹麦语语音数据集时的BuilderConfig错误

你在训练丹麦语ASR模型时遇到的这个问题很明确——报错信息直接说明,你指定的丹麦语代码da不在当前调用的数据集支持的语言配置列表里,从给出的可用列表也能看到,确实没有丹麦语(Danish)的选项。

给你几个实用的解决方向:

  • 切换到支持丹麦语的数据集版本
    如果你用的是Mozilla Common Voice这类主流语音数据集,早期版本(比如v6到v10)可能没收录丹麦语,但从v11版本开始已经加入了丹麦语支持。你可以直接指定最新的数据集版本调用,示例代码如下:

    load_dataset("mozilla-foundation/common_voice_11_0", "da")
    

    同时记得把你的datasets库升级到最新版,避免版本兼容问题:

    pip install --upgrade datasets
    
  • 核对目标数据集的官方说明
    如果你用的不是Common Voice,先去该数据集的Hub页面确认是否真的支持丹麦语。有些数据集可能用了不同的语言代码,或者需要特定的配置名称,别死磕da这个代码,看看文档里有没有丹麦语对应的正确标识。

  • 自定义加载丹麦语数据
    如果确实找不到官方支持的丹麦语数据集,你可以自己整理公开的丹麦语语音语料,然后用datasets库的Dataset.from_dict()方法把数据转换成标准Dataset格式,再对接wav2vec的训练流程即可。

内容的提问来源于stack exchange,提问作者Siyam Fahad

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.28 14:22:30