You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于Tesseract 4.0与C#实现文字坐标提取的可行性咨询

用C# Tesseract 4.0提取单词/字母坐标的可行性方案

当然可行!Tesseract 4.0的C#绑定完全支持提取每个单词(甚至单个字符)的坐标信息,这正好匹配你发票索引自动化中提取表格的需求。下面是具体的实现思路和代码示例:

核心实现步骤

  1. 安装Tesseract的C# NuGet包
    首先在你的项目中安装Tesseract包(当前主流版本已兼容4.0+,直接通过NuGet管理器搜索安装即可)。

  2. 初始化引擎并处理扫描文档
    指定tessdata语言包的本地路径,加载扫描后的发票图片,通过引擎的Process方法生成页面对象,之后就能遍历提取单词或字符的坐标了。

代码示例

using Tesseract;

// 初始化Tesseract引擎(替换tessdata路径为你本地的语言包目录)
using var engine = new TesseractEngine(@"C:\your-tessdata-folder", "eng", EngineMode.Default);
// 如果需要处理中文发票,把语言代码改成"chi_sim"

// 加载扫描的发票图片
using var scannedInvoice = Pix.LoadFromFile("invoice_scan.png");
using var page = engine.Process(scannedInvoice);

// 提取所有单词及其坐标
Console.WriteLine("=== 提取单词坐标 ===");
foreach (var word in page.GetWords())
{
    var box = word.BoundingBox;
    Console.WriteLine($"单词: *{word.Text}* | 坐标: 左={box.Left}, 上={box.Top}, 右={box.Right}, 下={box.Bottom}");
}

// 提取单个字母的坐标(如果单词粒度无法满足需求)
Console.WriteLine("\n=== 提取字符坐标 ===");
foreach (var character in page.GetCharacters())
{
    var box = character.BoundingBox;
    Console.WriteLine($"字符: *{character.Text}* | 坐标: 左={box.Left}, 上={box.Top}, 右={box.Right}, 下={box.Bottom}");
}

注意事项

  • 语言包准备:确保tessdata目录下有对应的语言训练数据(比如eng.traineddata或chi_sim.traineddata),否则识别和坐标提取都会失效。
  • 图片预处理:扫描文档如果存在模糊、阴影或倾斜问题,建议先做预处理(比如灰度化、二值化、旋转校正),这能大幅提升Tesseract的识别精度和坐标准确性。
  • 坐标含义:BoundingBox返回的是基于图片像素的矩形坐标,你可以利用这些坐标来判断内容所属的表格单元格,进而完成表格结构的提取。

内容的提问来源于stack exchange,提问作者Alexandra

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 07:32:39