You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为gImageReader中的Tesseract创建配置文件以禁用连字?

解决gImageReader中Tesseract连字识别的配置问题

嘿,我来帮你一步步搞定这个配置文件的问题,操作其实挺直接的:

1. 找到正确的配置文件存放路径

gImageReader自带的Tesseract会用它安装目录下的tessdata文件夹,你需要找到里面的configs子目录:

  • Windows系统默认路径大概是 C:\Program Files\gImageReader\share\tessdata\configs
  • Linux/macOS的话,可能在 /usr/share/tessdata/configs 或者你自定义安装路径的share/tessdata/configs里

要是找不到configs文件夹也没关系,直接手动新建一个就行——Tesseract会自动读取这个目录下的配置。

2. 创建配置文件的规则

  • 命名:配置文件是无后缀的纯文本文件,文件名就是你之后要调用的配置名(比如叫noligatures就很直观,意思是禁用连字)。
  • 格式:每一行写一个Tesseract引擎参数,语法很简单:参数名 参数值,参数和值之间用空格分开就行。

3. 添加控制连字的参数

针对你不想让Tesseract把“fi”识别成单个连字“fi”的需求,把下面这两行写到配置文件里:

preserve_interword_spaces 0
tessedit_char_blacklist fifl

要是你反过来想强制保留连字(让Tesseract把“fi”识别成单个字符而不是拆成f+i),就用这个配置:

tessedit_char_whitelist fifl

给你解释下这些参数:

  • preserve_interword_spaces:调整单词间空格的识别逻辑,配合连字设置能优化效果
  • tessedit_char_blacklist:告诉Tesseract忽略这些字符,这里加了“fi”“fl”,引擎就不会把f+i组合识别成这些连字了
  • tessedit_char_whitelist:只允许引擎识别指定的字符,适合需要强制保留连字的场景

4. 在gImageReader里启用配置

配置文件建好后,打开gImageReader:

  • 点进**设置(Settings)**界面
  • 找到Tesseract相关的选项,在“配置文件(Config File)”的下拉菜单里选你刚创建的那个配置名(比如noligatures)
  • 保存设置后,重新跑OCR就能看到效果了

小提醒

  • 配置文件一定要用UTF-8编码,不然可能会出现乱码导致参数失效
  • 要是你用的Tesseract版本比较老,部分参数可能有变化,可以查对应版本的官方文档调整
  • 测试的时候找一段包含“fi”“fl”的文本试试,确认配置生效没

内容的提问来源于stack exchange,提问作者Böris Jürgen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.28 06:27:15