You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

训练STANZA的POS标注模型时遇乌尔都语代码查找错误如何解决?

解决Stanza POS模型训练时"Unable to find language code for URDU"错误

问题根源

Stanza内部采用小写ISO语言代码映射语言,乌尔都语对应的标准代码是ur,你命令里UD_URDU-UDTB中的大写URDU无法被识别为有效语言代码。

解决步骤

  • 修正树库标识格式:Stanza对UD树库的命名规范为[语言代码]_[树库后缀],乌尔都语UDTB的正确标识是ur_udtb,执行以下命令:
    python3 -m stanza.utils.datasets.prepare_pos_treebank ur_udtb
    
  • 指定自定义数据目录(可选):如果你的UD_URDU-UDTB目录不在Stanza默认路径,用--data_dir参数指定路径:
    python3 -m stanza.utils.datasets.prepare_pos_treebank ur_udtb --data_dir /path/to/your/dataset/folder
    
  • 强制指定语言代码:若要保留原树库名称,通过--lang参数手动指定乌尔都语代码ur:
    python3 -m stanza.utils.datasets.prepare_pos_treebank UD_URDU-UDTB --lang ur
    

验证语言支持

可通过以下代码确认Stanza支持的语言及对应代码:

import stanza
print(stanza.supported_languages())

输出中会明确包含ur(乌尔都语)。

内容的提问来源于stack exchange,提问作者Determinator

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.22 20:48:14