Debian 12版Peppermint OS中Tesseract 5识别乱码问题求助
解决Tesseract 5在Debian 12 Peppermint OS上的OCR乱码问题
临时优化方案(无需降级)
- 调整gImageReader的Tesseract参数:
- 打开gImageReader,进入偏好设置
- 切换到OCR引擎标签页,在Tesseract的额外参数栏添加:
--psm 6(强制按单一连续文本块识别,减少空白区域的误识别) - 可尝试其他页面分割模式(PSM),比如
--psm 3(自动模式)或--psm 11(稀疏文本适配)
- 图片预处理:
用GIMP等工具对识别图片做预处理:- 提升对比度、去除背景噪点
- 裁剪掉无关的空白边缘
- 将图片转为纯黑白(通过阈值调整强化文本边缘)
绕过依赖限制降级Tesseract 4.1.1
- 手动安装Debian 11版本的deb包:
- 从Debian官方仓库获取对应架构的
tesseract-ocr、libtesseract4等相关依赖包 - 执行
dpkg -i *.deb强制安装,若出现依赖错误,运行apt-get -f install尝试修复(注意:此操作可能破坏系统依赖链,需谨慎操作)
- 从Debian官方仓库获取对应架构的
- 容器隔离运行:
用Docker搭建Debian 11环境并安装Tesseract 4.1.1,配置gImageReader调用容器内的Tesseract可执行文件,实现版本隔离
排查Tesseract 5本身配置问题
- 检查语言包完整性:
运行dpkg -l | grep tesseract-ocr-确认目标语言包是否安装,若缺失,执行apt install tesseract-ocr-[lang](例如中文简体为tesseract-ocr-chi-sim) - 重置Tesseract配置:
删除用户目录下的自定义配置文件~/.config/tesseract/configs,恢复默认配置后重新测试
内容的提问来源于stack exchange,提问作者Real Bezo
相关产品推荐
相关产品推荐

