You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Google Colab中提取图片文本遇TesseractNotFoundError求助

解决Colab中TesseractNotFoundError的问题

你犯了一个关键错误:Google Colab是运行在云端Linux服务器上的环境,不是你本地的Windows系统,所以你指定的Windows本地路径C:\Program Files\Tesseract-OCR\tesseract (2).exe在Colab里完全不存在,这就是报错的原因。

解决步骤:

  • 第一步,在Colab中安装Tesseract OCR,执行以下命令:
    sudo apt install tesseract-ocr
    
  • 第二步,修改代码:不需要设置Windows路径,安装后pytesseract会自动识别Linux下的默认路径;如果要手动指定,路径是/usr/bin/tesseract。同时确保你的图片已经上传到Colab的/content/images/目录下。

修改后的代码示例:

from PIL import Image
from pytesseract import pytesseract

image_path = r"/content/images/result_Page_1.jpg"

img = Image.open(image_path)

# 可选:如果需要手动指定路径,保留下面这行,否则可删除
# pytesseract.tesseract_cmd = "/usr/bin/tesseract"

text = pytesseract.image_to_string(img)

print(text[:-1])

内容的提问来源于stack exchange,提问作者Aradhya Sharma

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 16:40:22