You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Cognitive Search中OCR技能集contentOffset来源问题

Azure Cognitive Search 中 contentOffset 字段的生成来源

/document/normalized_images/*/contentOffset 既不是OcrSkill生成的输出字段,也不是计算机视觉Read API返回的结果,它是Azure Cognitive Search索引器内置文档解析阶段(文档裂解阶段)自动生成的元数据字段,生成时机在技能集执行之前。

具体生成逻辑和相关规则如下:

  • 触发生成的前提是你在索引器配置中,将imageAction参数设置为generateNormalizedImages(开启内嵌图片提取与标准化处理能力)。这个配置生效后,索引器在处理PDF、Word、PPT等包含内嵌资源的文档时,会先于技能集运行完成内置预处理:
    • 提取文档中所有内嵌图片,做尺寸统一、方向校正等标准化处理,组装成/document/normalized_images数组
    • 逐张计算每张内嵌图片在原文档提取出的纯文本内容流中对应的插入位置,把计算得到的字符偏移量作为contentOffset字段,挂载到对应的normalized_images数组项上
  • OcrSkill运行时,只会读取每个normalized_image项中存储的图片二进制数据做识别,往对应节点下写入自己负责输出的text、layoutText字段,不会修改预处理阶段已经生成的contentOffset字段。两个字段同属/document/normalized_images/*节点,但来源完全独立,这也是你在OcrSkill输出说明里找不到这个字段的原因。
  • 注意:如果没有开启索引器的内置标准化图片生成能力,比如你是通过自定义技能传入外部图片、或者手动构造normalized_images数组,contentOffset字段不会自动生成,后续MergeSkill就无法拿到正确的偏移位置完成OCR文本和原文档内容的合并。

补充:和contentOffset同时在预处理阶段自动生成的同节点元数据字段还包括与contentOffset配套的pageNumber(图片所在原文档的页码)、图片标准化后的宽高数据等,都不属于任何自定义技能的输出范畴。

内容的提问来源于stack exchange,提问作者michasaucer

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.01 13:42:29