You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

训练Document AI表单OCR处理器遇无效数据集错误求助

Document AI训练数据集错误分析与修复方案

错误原因

  • 核心问题:文档5c7a8b0949921910.json里的telefone-contato-prestador标注实体中,text_anchor.text_segments字段长度为0,违反了训练要求的「至少包含1个文本片段」规则,这是触发Invalid dataset错误的直接原因。
  • 排除文档数量问题:你已使用10份训练文档,满足Document AI自定义模型训练的最低数据量要求(通常为10份),所以数量不足不是报错原因。

修正步骤

  • 定位问题源:找到5c7a8b0949921910.json对应的原始表单,确认telefone-contato-prestador(服务商联系电话)字段是否有有效文本。
  • 修复标注JSON:
    1. 若原始表单该字段有内容:补充text_segments的正确索引信息,示例格式如下:
      "entities": [
        {
          "type": "telefone-contato-prestador",
          "text_anchor": {
            "text_segments": [
              {
                "start_index": "xxx",
                "end_index": "yyy"
              }
            ]
          }
        }
      ]
      
    2. 若原始表单该字段确实为空:要么删除该字段对应的实体标注,要么通过标注工具标记为「无内容」(部分工具会生成符合规则的空值标注结构)。
  • 批量排查:因为字段数量多,建议批量检查所有训练/测试文档的标注JSON,确保所有实体的text_segments都满足至少1个的要求,避免其他文档存在同类问题。

内容的提问来源于stack exchange,提问作者Rodrigo Martins

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 09:55:19