You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure AI Search:非PDF文件无法生成标准化图片的技术咨询

解决Azure AI Search中Office文档(docx/pptx)生成标准化图片用于OCR/hOCR的问题

Azure AI Search的内置索引器仅支持对PDF文件自动生成标准化图片,docx、pptx等Office文档确实无法通过内置能力完成这一步。针对你的需求,有两种可行方案:

方案一:通过自定义技能实现文档转图片

你可以借助Azure Functions构建自定义技能,将docx/pptx转换为单页图片,再接入到索引器的技能流中:

  • 实现文档转换逻辑:在Azure Function中调用Office转换工具(如LibreOffice命令行工具,或利用Microsoft Graph API的文档转换接口),将docx/pptx文件逐页转换为PNG/JPG等格式的图片。
  • 集成到技能集:在Azure AI Search的技能集中添加自定义技能节点,将原Office文档作为输入,输出转换后的图片,再串联后续的OCR/hOCR处理技能,最终将hOCR结果存入Blob存储。

方案二:提前预处理文件,自行生成图片

在将docx/pptx上传到Blob存储前,先通过本地或云端自动化工具完成文档到图片的转换:

  • 批量转换:使用Office自动化工具(如PowerShell脚本调用Microsoft Office组件、LibreOffice批量转换)将每个Office文档转换为对应页数的图片文件。
  • 关联存储:将原文件和对应的图片文件一同上传到Blob存储,配置索引器时直接指向图片文件路径,触发OCR/hOCR流程生成所需结果。

两种方案中,方案一适合需要端到端自动化处理的场景,方案二更适合对文件预处理流程有较强控制需求的场景,可根据业务实际情况选择。

内容的提问来源于stack exchange,提问作者Mike

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.30 03:19:56