You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Tesseract无法加载eng语言包求助(已重装仍未解决)

更新说明
  • 已将Tesseract重装至“Program Files (x86)”文件夹,现在运行tesseract --version可返回版本信息,不再提示“未被识别为cmdlet”
问题求助

这是个常见问题,试过多种方法都没解决,网上类似方案也无效,求新思路,感谢!

具体错误信息

pytesseract.pytesseract.TesseractError: (1, 'Error opening data file C:\Program Files (x86)\Tesseract-OCR\tessdata/eng.traineddata Please make sure the TESSDATA_PREFIX environment variable is set to the parent directory of your "tessdata" directory. Failed loading language 'eng' Tesseract couldn't load any languages! Could not initialize tesseract.')

当前使用的代码
from pdf2image import convert_from_path
import pytesseract

images = convert_from_path("CHECK_12-01-22.pdf", 500, poppler_path=r'C:\Program Files\poppler-23.01.0\Library\bin')
for i, image in enumerate(images):
    fname = 'image' + str(i) + '.png'
    image.save(fname, "PNG")

pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract-OCR\tesseract.exe'

text = pytesseract.image_to_string(image, lang='eng')
# text = pytesseract.image_to_string(image, lang='eng', config='--tessdata-dir "C:\\Program Files\\Tesseract-OCR\\tessdata"')
环境与已尝试方案
  • 环境:Windows 11 + PyCharm
  • Poppler工作正常,能将PDF转换为图片,但Tesseract提示无法找到语言包
  • 已尝试的无效方案:
    1. 设置了环境变量
    2. 在代码中添加config='--tessdata-dir "C:\\Program Files\\Tesseract-OCR\\tessdata"'参数
    3. 下载不同的语言数据文件放入tessdata文件夹

内容的提问来源于stack exchange,提问作者Damon Schulz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 16:20:24