You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure认知服务Document Extraction技能定义后如何上传文件解析

完整后续操作说明

你已经完成了文档提取技能和技能集的创建,接下来根据你的使用场景,分两种路径操作:

场景1:批量处理存储端的PDF/DOCX文件(主流生产场景)

Azure认知搜索的技能集默认是和索引器绑定工作的,不会直接接收本地文件传入,操作步骤如下:

  • 先准备数据源:把所有需要解析的文档上传到Azure Blob存储的专用容器中
  • 创建数据源连接:调用_indexerClient.CreateOrUpdateDataSourceConnectionAsync方法,创建类型为AzureBlob的数据源对象,关联你存文件的Blob容器
  • 创建搜索索引:定义包含输出字段的索引结构,必须包含你技能输出映射的extracted_content字段,设置对应的可查询/可检索属性
  • 创建绑定索引器:把数据源、已创建的DocumentSkillset技能集、搜索索引三者绑定到同一个索引器对象中,调用方法创建索引器后运行,索引器会自动拉取容器内的文件,调用文档提取技能完成解析,最终把解析出的文本和元数据写入搜索索引

场景2:单文件即时解析测试(对应你贴的JSON示例)

你给出的JSON结构是技能集按需调用接口的请求体,这个能力不需要依赖索引器、数据源,适合单文件即时测试场景:

  • 你需要先把本地要解析的文件读取为字节流,再编码为Base64字符串
  • 按照你贴的JSON结构构造请求:recordId可以自定义用于标识文件,data下的file_data固定设置"$type": "file",data字段填刚才生成的文件Base64字符串
  • C#中直接调用_indexerClient.SkillsetClient.InvokeSkillsetAsync方法,传入技能集名称和构造好的请求对象,即可直接拿到解析返回的extracted_content内容

注意事项

你当前技能定义里的Description写的是「从图像提取文本」,和你的文档提取场景不符,可以按需修改,不影响实际运行效果。

内容的提问来源于stack exchange,提问作者Bitz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 16:15:03