You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Microsoft Translator Hub添加的文档未出现在训练等数据集窗口

文档无法在训练模块中选中的排查与解决

嘿,咱们一起排查这个问题——你的文档能在Documents标签页正常显示,但在Training、Tuning、Testing或Dictionary窗口里找不到,想启动初始训练都选不了,确实挺闹心的。下面是最常见的几个排查方向和解决办法:

1. 文档类型与属性未正确配置

系统只会把标记为训练可用类型的文档同步到训练模块,先检查这一点:

  • 单语文档:在Documents标签页找到你的文件,点击编辑属性,确认是否勾选了对应的语料类型(比如「源语言单语」或「目标语言单语」)。如果上传时没指定类型,系统可能默认归类为普通文档,不会进入训练候选池。
  • 双语文档:必须是对齐的双语语料才能被训练模块识别。如果你的双语文档是未对齐的(比如把源语和目标语混在同一个文件里,没有按行或段落对应),系统会无法识别为训练可用的双语对。你可以查看文档详情页的标签,要是没有「双语对齐语料」标识,要么重新上传时选择正确的文档类型,要么先用工具完成双语对齐后再上传。

2. 文档后台处理未完成

很多工具会对上传的文档做后台解析(比如PDF转可编辑文本、格式校验、语料清洗),即使在Documents标签页能看到,可能还处于「处理中」状态:

  • 查看文档的状态标识,要是显示「待处理」「解析中」,耐心等它完成后再去训练窗口刷新。
  • 如果长时间卡在处理状态,试试重新上传文档:确保PDF是可复制的(不是扫描件),TXT文件用UTF-8编码,避免用特殊格式的文档。

3. 训练窗口的筛选条件限制

有时候不是文档没同步,是你当前的筛选条件把它排除了:

  • 打开Training/Tuning窗口后,看看顶部的筛选器,是否设置了特定的语言对、文档类型或状态。比如你上传的是中文单语,但筛选器只勾选了「双语语料」,那肯定找不到。
  • 点击「重置筛选」按钮,再重新浏览所有可用文档,大概率能看到你的文件。

4. 系统缓存或索引未更新

工具的索引模块没及时同步Documents的内容,也会导致这个问题:

  • 先刷新训练窗口的页面,或者退出系统重新登录试试。
  • 如果是本地部署的工具,可能需要重启服务,或者在后台管理里找到「重建语料索引」的选项手动触发更新。

5. 文档命名或路径的问题

有些工具对特殊字符(比如空格、中文标点、特殊符号)的支持不好,导致文档无法被训练模块识别:

  • 试试把文档重命名为简单的英文/数字组合,比如zh_monolingual_001.txt,然后重新上传。

如果以上方法都试过还是不行,建议查看工具的日志文件(一般在安装目录或后台管理面板能找到),里面会有文档解析、索引同步的错误提示,能帮你定位更具体的问题。

内容的提问来源于stack exchange,提问作者Helen Horgan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.22 08:48:57