Azure OpenAI搜索服务与Studio:非支持文件类型及引文优化问题
问题解决方案
一、扩展支持的文件类型(图片、邮件、Excel)
1. Excel文件(.xls、.xlsx)
Azure AI Search的SharePoint索引器原生支持Excel文件,只需调整索引器配置:
- 在字段映射环节,系统默认会提取Excel单元格文本到
content字段。如果需要保留表格结构,可添加表格理解技能,将表格解析为结构化字段(如table_rows、table_columns),或用Microsoft.Skills.Text.SplitSkill按换行符拆分内容,方便后续搜索匹配。 - 确认SharePoint站点权限配置,确保Azure AI Search服务主体拥有读取Excel文件的权限。
2. 邮件(.eml、.msg)
通过内置邮件解析技能实现索引:
- 在索引器的技能集中添加
EmailExtractionSkill,指定输入为文档的content字段,输出可定义为sender、recipients、email_subject、email_body等自定义字段,将这些字段添加到搜索索引的字段集合中。 - 该技能会自动拆分邮件的核心信息,无需额外处理即可实现邮件内容的搜索与检索。
3. 图片文件(.jpg、.png、.gif等)
结合OCR技能提取图片中的文本:
- 在技能集中添加OCR技能,设置
defaultLanguageCode(如zh-CN对应中文),输入字段选择文档的content或document对象,输出字段定义为ocr_content,并将其映射到搜索索引的content字段。 - 无论是独立图片文件,还是嵌入在PDF、Word中的图片,OCR技能都会自动识别并提取其中的文字内容,纳入搜索索引。
二、优化引文显示与原始文档访问
1. 获取原始文档完整路径并打开
完全可行,操作步骤如下:
- 在搜索索引中新增自定义字段(如
document_full_url),用于存储SharePoint文档的直接访问地址。 - 在索引器的字段映射中,将SharePoint文档的
metadata_spo_item_url字段(原生包含文档的完整SharePoint URL)映射到document_full_url字段。 - 在Web应用的响应渲染逻辑中,把引文链接指向
document_full_url的值,用户点击后将直接打开SharePoint上的原始文档,保留所有原生格式。
2. 实现引文内容格式化显示
通过结构化内容提取实现格式保留:
- 索引阶段,使用Azure Form Recognizer自定义技能,提取Word、PDF等文档的结构化格式信息(如标题层级、段落样式、列表、表格),将格式化后的HTML内容存储到索引的自定义字段(如
formatted_content)中。 - 在Web应用的引文窗口中,直接渲染
formatted_content字段的HTML内容,即可还原原文档的格式布局。 - 若依赖内置技能,可通过
SplitSkill拆分文档的结构化区块(如标题、正文),再用MergeSkill按原顺序组合,渲染时为不同区块添加对应格式标签。
内容的提问来源于stack exchange,提问作者c0D3l0g1c
相关产品推荐
相关产品推荐

