You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

.NET Tesseract 5.2.0 OCR字符识别错误问题求助

.NET Tesseract 5.2.0图片文本识别问题及免费解决方案需求

问题描述

我使用.NET Tesseract(5.2.0)包提取图片文本,目标图片是包含等号的三行简单文本,但识别结果要么完全错误,要么存在字符偏差——比如把2005识别成005,=S识别成=8。我需要找到免费方案,证明该图片的文本可以被正确识别,不想使用付费服务。

已尝试操作

  • 调整DefaultPageSegMode参数,测试后发现SparseText模式的识别效果相对最佳

示例代码

using (var engine = new TesseractEngine(@"C:\Users\Eren1\source\repos\DeleteLater_ReadImage\DeleteLater_ReadImage\bin\Debug\net7.0\tessdata", "eng", EngineMode.TesseractAndLstm))
{
    engine.DefaultPageSegMode = PageSegMode.SparseText;

    using (var img = Pix.LoadFromFile(@"C:\Users\Eren1\source\repos\DeleteLater_ReadImage\DeleteLater_ReadImage\bin\Debug\net7.0\test9.png"))
    using (var page = engine.Process(img))
    {
        var text = page.GetText();

        using (var iter = page.GetIterator())
        {
            iter.Begin();
            string text2 = iter.GetText(PageIteratorLevel.Block);
            iter.Next(PageIteratorLevel.Block);
        }

        // text variable contains a string with all words found
        return text;
    }
}

当前识别输出

005

1FH13=8

2005060

e N

(o) (o) — |

预期正确识别结果示例

  • 005应识别为2005
  • =8应识别为=S

内容的提问来源于stack exchange,提问作者MonkeyDLuffy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 20:55:10