.NET Tesseract 5.2.0 OCR字符识别错误问题求助
.NET Tesseract 5.2.0图片文本识别问题及免费解决方案需求
问题描述
我使用.NET Tesseract(5.2.0)包提取图片文本,目标图片是包含等号的三行简单文本,但识别结果要么完全错误,要么存在字符偏差——比如把2005识别成005,=S识别成=8。我需要找到免费方案,证明该图片的文本可以被正确识别,不想使用付费服务。
已尝试操作
- 调整
DefaultPageSegMode参数,测试后发现SparseText模式的识别效果相对最佳
示例代码
using (var engine = new TesseractEngine(@"C:\Users\Eren1\source\repos\DeleteLater_ReadImage\DeleteLater_ReadImage\bin\Debug\net7.0\tessdata", "eng", EngineMode.TesseractAndLstm)) { engine.DefaultPageSegMode = PageSegMode.SparseText; using (var img = Pix.LoadFromFile(@"C:\Users\Eren1\source\repos\DeleteLater_ReadImage\DeleteLater_ReadImage\bin\Debug\net7.0\test9.png")) using (var page = engine.Process(img)) { var text = page.GetText(); using (var iter = page.GetIterator()) { iter.Begin(); string text2 = iter.GetText(PageIteratorLevel.Block); iter.Next(PageIteratorLevel.Block); } // text variable contains a string with all words found return text; } }
当前识别输出
005 1FH13=8 2005060 e N (o) (o) — |
预期正确识别结果示例
005应识别为2005=8应识别为=S
内容的提问来源于stack exchange,提问作者MonkeyDLuffy
相关产品推荐
相关产品推荐

