You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用DocumentAI准确检测文档图像中的非文本视觉元素?

用Google DocumentAI检测文档中的非文本视觉元素

核心解决方案:利用Block的block_type字段

DocumentAI在分析文档时,会为每个Block标注明确的类型,通过这个字段可以直接区分文本与非文本元素,彻底避免单纯靠面积判断的误判问题。支持的关键Block类型包括:

  • TEXT:纯文本块
  • IMAGE:图像类视觉元素
  • TABLE:表格元素
  • LAYOUT:布局类非文本元素

修正后的检测代码

def has_visual_elements(page):
    """检查页面是否包含非文本视觉元素"""
    NON_TEXT_TYPES = {"IMAGE", "TABLE", "LAYOUT"}
    for block in page.blocks:
        # 直接判断Block类型是否属于非文本范畴
        if block.block_type in NON_TEXT_TYPES:
            return True
    return False

补充说明

如果需要更精细的识别(比如仅检测内嵌图像),可以单独针对IMAGE类型做判断;对于大段纯文本被识别为单个TEXT块的场景,这种基于类型的判断不会像面积法那样出现误判。

(你提供的示例图像包含内嵌图表类视觉元素,用上述方法可准确识别)

内容的提问来源于stack exchange,提问作者jonah_w

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.14 19:54:55