You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Document Intelligence API与Studio模型检测结果差异原因咨询

问题分析:Document Intelligence Studio与Python API的结果差异

我使用Azure Document Intelligence的prebuilt-layout模型(更换为prebuilt-document模型后问题依旧),通过Python API调用分析PDF时,返回的sectionHeadings及标题数量,比直接在Document Intelligence Studio上传同一份PDF检测到的结果少。Python代码如下:

with open(file_path, "rb") as pdf:
    print(pdf)
    poller = document_analysis_client.begin_analyze_document(
        model_id="prebuilt-layout",
        document=pdf
    )

可能的原因:

  • API版本不匹配:Document Intelligence Studio默认调用最新稳定版API,而你本地Python SDK依赖的API版本可能较旧。不同版本的模型对标题、章节标题的识别逻辑有迭代更新,旧版本的识别覆盖范围不如新版。
  • 请求参数差异:Studio在后台调用API时,可能默认启用了某些增强分析选项,而你的Python代码仅使用基础参数发起请求。比如是否指定了pages范围、启用了文本索引增强,或者开启了特定的布局分析模式。
  • PDF文件处理差异:本地读取PDF时,可能存在文件路径错误、文件隐式损坏(比如本地副本有问题,而上传到Studio的是原始完好文件),导致API接收到的文档内容不完整。需确认本地读取的是完整的PDF字节流。
  • 服务区域差异:如果你的Python API调用的是某一特定区域的服务,而Studio使用的是另一区域,不同区域的模型可能存在版本同步延迟,导致识别效果不一致。

内容的提问来源于stack exchange,提问作者alex jo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 12:02:44