使用img2table与Tesseract提取图片表格失败的问题排查及解决方法求助
img2table与Tesseract提取图片表格失败的问题排查及解决方法求助
我最近一直在尝试用img2table搭配Tesseract提取图片里的表格,但不管怎么调整参数,结果始终是空列表[],完全提取不出表格。有没有大佬能帮我看看问题出在哪?怎么才能成功提取这类图片里的表格呢?
我的代码如下:
from img2table.ocr import TesseractOCR from img2table.document import Image # 实例化OCR ocr = TesseractOCR(n_threads=1, lang="eng") # 实例化文档(图片或PDF) src = "table.png" doc = Image(src) # 提取表格 extracted_tables = doc.extract_tables(ocr=ocr, implicit_rows=True, borderless_tables=True, min_confidence=50) In [2]: extracted_tables Out[2]: []
我的环境版本信息:
- img2table==1.2.8
- opencv-python==4.9.0.80
- pytesseract==0.3.10
- Tesseract版本:
tesseract 4.1.1 leptonica-1.82.0 libgif 5.1.9 : libjpeg 8d (libjpeg-turbo 2.1.1) : libpng 1.6.37 : libtiff 4.3.0 : zlib 1.2.11 : libwebp 1.2.2 : libopenjp2 2.4.0 Found AVX2 Found AVX Found FMA Found SSE Found libarchive 3.6.0 zlib/1.2.11 liblzma/5.2.5 bz2lib/1.0.8 liblz4/1.9.3 libzstd/1.4.8
(注:原问题中未提供table.png的具体内容,如果能补充图片细节,比如表格是否有边框、字体清晰度、是否存在倾斜/畸变等,会更有助于排查问题)
我自己初步排查过的方向,但还没解决问题:
- 单独用pytesseract能正常识别图片里的文字,但就是提取不出表格结构
- 调整过
min_confidence参数(从30到80),也试过关闭borderless_tables或implicit_rows,结果还是空列表
有没有遇到过类似问题的朋友,能给我一些建议或者解决方案吗?
备注:内容来源于stack exchange,提问作者Michael
相关产品推荐
相关产品推荐

