You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Tesseract 5.3.0训练时所有0字符均出现Couldn't find a matching blob错误

Tesseract训练中0字符匹配失败的解决办法

可行的排查与修复步骤

  • 校验box文件坐标的准确性与格式
    确认box文件里的坐标都是整数,且符合Tesseract的坐标系规则:x_left y_top x_right y_bottom page,注意y轴是从图像顶部开始向下计数。如果QT Box Editor保存的坐标带有小数,手动改为整数后重新运行box.train命令。

  • 重新生成并修正box文件
    删除现有box文件,重新执行:

    tesseract.exe 1.png 1 batch.nochop makebox
    

    打开生成的box文件,直接在QT Box Editor里调整每个0字符的框选范围,确保完全覆盖字符且无重叠,保存时检查文件末尾有没有多余的空行或空格。

  • 优化训练图像的质量
    将1.png转为单通道灰度图,调整对比度让0字符的边缘清晰,消除模糊或噪点。模糊的字符会导致Tesseract无法识别对应的blob,这是常见的匹配失败原因。

  • 指定训练时的PSM模式
    执行box.train时添加*--psm 7*参数(强制按单行文本处理),命令改为:

    tesseract.exe 1.png 1 --psm 7 box.train
    

    这个参数能避免Tesseract对文本行的错误分割,减少blob匹配的偏差。

  • 检查unicharset字符集
    确认训练用的unicharset文件包含0字符。如果没有,重新生成:

    1. 把所有训练用的box文件放到同一目录
    2. 运行unicharset_extractor *.box生成新的unicharset
    3. 查看生成的文件,确保有0的条目
  • 更换训练图像测试
    如果以上方法都无效,换几张包含0字符的训练图,确保0的字体样式和其他字符一致,避免因0和8的形状过于接近导致识别混淆。


内容的提问来源于stack exchange,提问作者Maximus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 10:45:28