在Google Colab中提取图片文本遇TesseractNotFoundError求助
解决Colab中TesseractNotFoundError的问题
你犯了一个关键错误:Google Colab是运行在云端Linux服务器上的环境,不是你本地的Windows系统,所以你指定的Windows本地路径C:\Program Files\Tesseract-OCR\tesseract (2).exe在Colab里完全不存在,这就是报错的原因。
解决步骤:
- 第一步,在Colab中安装Tesseract OCR,执行以下命令:
sudo apt install tesseract-ocr - 第二步,修改代码:不需要设置Windows路径,安装后pytesseract会自动识别Linux下的默认路径;如果要手动指定,路径是
/usr/bin/tesseract。同时确保你的图片已经上传到Colab的/content/images/目录下。
修改后的代码示例:
from PIL import Image from pytesseract import pytesseract image_path = r"/content/images/result_Page_1.jpg" img = Image.open(image_path) # 可选:如果需要手动指定路径,保留下面这行,否则可删除 # pytesseract.tesseract_cmd = "/usr/bin/tesseract" text = pytesseract.image_to_string(img) print(text[:-1])
内容的提问来源于stack exchange,提问作者Aradhya Sharma
相关产品推荐
相关产品推荐

