You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何限制PyTesseract识别字符的最大像素尺寸以规避图表误识别

PyTesseract限制识别字符最大尺寸的实现方法

方法1:结构化识别结果过滤(兼容性最佳,适配你使用的5.0.0-alpha版本)

该方法先获取所有识别块的宽高属性,再按自定义阈值过滤,避免误识别图表内容,实现步骤:

  • 调用pytesseract.image_to_data接口获取包含每个识别单元位置、宽高、文本内容的结构化数据
  • 过滤掉宽高超出最大限制的识别块,拼接剩余有效文本

示例代码:

import pytesseract
from PIL import Image

# 读取待识别扫描件
scan_img = Image.open("scan_document.png")
# 输出结构化识别数据
ocr_details = pytesseract.image_to_data(scan_img, output_type=pytesseract.Output.DICT)

# 自定义字符最大宽高阈值,单位为像素,可根据扫描件DPI灵活调整
MAX_CHAR_WIDTH = 55
MAX_CHAR_HEIGHT = 90

valid_content = []
for idx in range(len(ocr_details['text'])):
    text = ocr_details['text'][idx].strip()
    # 仅保留非空、尺寸符合要求的识别结果
    if text and ocr_details['width'][idx] <= MAX_CHAR_WIDTH and ocr_details['height'][idx] <= MAX_CHAR_HEIGHT:
        valid_content.append(text)

# 得到最终识别结果
final_text = ' '.join(valid_content)

方法2:使用Tesseract内置参数直接限制

你也可以通过自定义识别配置,让Tesseract内核在识别阶段直接忽略尺寸超过阈值的字符块,示例代码:

import pytesseract
from PIL import Image

scan_img = Image.open("scan_document.png")
# 配置字符最大宽高参数,数值单位为像素
custom_config = r'--textord-max-char-width 55 --textord-max-char-height 90'
final_text = pytesseract.image_to_string(scan_img, config=custom_config)

如果你的扫描件中图表区域整体尺寸远大于普通文本,还可以提前对图像做连通域分析,将面积超过阈值的区域涂黑后再传入识别接口,可进一步提升识别效率和准确率。

内容的提问来源于stack exchange,提问作者Dev Bhuyan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 11:24:04