You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用img2table与Tesseract提取图片表格失败的问题排查及解决方法求助

img2table与Tesseract提取图片表格失败的问题排查及解决方法求助

我最近一直在尝试用img2table搭配Tesseract提取图片里的表格,但不管怎么调整参数,结果始终是空列表[],完全提取不出表格。有没有大佬能帮我看看问题出在哪?怎么才能成功提取这类图片里的表格呢?

我的代码如下:

from img2table.ocr import TesseractOCR
from img2table.document import Image

# 实例化OCR
ocr = TesseractOCR(n_threads=1, lang="eng")

# 实例化文档(图片或PDF)
src = "table.png"
doc = Image(src)

# 提取表格
extracted_tables = doc.extract_tables(ocr=ocr,
                                      implicit_rows=True,
                                      borderless_tables=True,
                                      min_confidence=50)

In [2]: extracted_tables
Out[2]: []

我的环境版本信息:

  • img2table==1.2.8
  • opencv-python==4.9.0.80
  • pytesseract==0.3.10
  • Tesseract版本:
tesseract 4.1.1
leptonica-1.82.0
libgif 5.1.9 : libjpeg 8d (libjpeg-turbo 2.1.1) : libpng 1.6.37 : libtiff 4.3.0 : zlib 1.2.11 : libwebp 1.2.2 : libopenjp2 2.4.0
Found AVX2
Found AVX
Found FMA
Found SSE
Found libarchive 3.6.0 zlib/1.2.11 liblzma/5.2.5 bz2lib/1.0.8 liblz4/1.9.3 libzstd/1.4.8

(注:原问题中未提供table.png的具体内容,如果能补充图片细节,比如表格是否有边框、字体清晰度、是否存在倾斜/畸变等,会更有助于排查问题)

我自己初步排查过的方向,但还没解决问题:

  • 单独用pytesseract能正常识别图片里的文字,但就是提取不出表格结构
  • 调整过min_confidence参数(从30到80),也试过关闭borderless_tables或implicit_rows,结果还是空列表

有没有遇到过类似问题的朋友,能给我一些建议或者解决方案吗?

备注:内容来源于stack exchange,提问作者Michael

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.20 06:14:32