Azure AI Search:非PDF文件无法生成标准化图片的技术咨询
解决Azure AI Search中Office文档(docx/pptx)生成标准化图片用于OCR/hOCR的问题
Azure AI Search的内置索引器仅支持对PDF文件自动生成标准化图片,docx、pptx等Office文档确实无法通过内置能力完成这一步。针对你的需求,有两种可行方案:
方案一:通过自定义技能实现文档转图片
你可以借助Azure Functions构建自定义技能,将docx/pptx转换为单页图片,再接入到索引器的技能流中:
- 实现文档转换逻辑:在Azure Function中调用Office转换工具(如LibreOffice命令行工具,或利用Microsoft Graph API的文档转换接口),将docx/pptx文件逐页转换为PNG/JPG等格式的图片。
- 集成到技能集:在Azure AI Search的技能集中添加自定义技能节点,将原Office文档作为输入,输出转换后的图片,再串联后续的OCR/hOCR处理技能,最终将hOCR结果存入Blob存储。
方案二:提前预处理文件,自行生成图片
在将docx/pptx上传到Blob存储前,先通过本地或云端自动化工具完成文档到图片的转换:
- 批量转换:使用Office自动化工具(如PowerShell脚本调用Microsoft Office组件、LibreOffice批量转换)将每个Office文档转换为对应页数的图片文件。
- 关联存储:将原文件和对应的图片文件一同上传到Blob存储,配置索引器时直接指向图片文件路径,触发OCR/hOCR流程生成所需结果。
两种方案中,方案一适合需要端到端自动化处理的场景,方案二更适合对文件预处理流程有较强控制需求的场景,可根据业务实际情况选择。
内容的提问来源于stack exchange,提问作者Mike
相关产品推荐
相关产品推荐

