You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Azure Cognitive Search从非结构化文档中精准检索问题答案

Azure Cognitive Search 落地问题对应解决方案

停用词干扰、检索结果不精准问题修复

  • 调整索引分析器配置:默认标准分析器未针对中英文混合场景做停用词过滤,会将where/are这类无实际语义的高频虚词计入匹配权重。给存储文档正文的字段指定分析器为zh-Hans.microsoft,即可自动过滤中英文通用停用词,避免虚词匹配的无效文档排在结果前列。
  • 优化检索匹配规则:检索请求设置searchMode=all,要求查询串中"橙子""种植"这类核心实体词全部命中才纳入返回结果;同时给不同索引字段设置差异化权重,比如文档标题字段权重设为5、正文切分块字段权重设为1,进一步提升结果相关性。
  • 优化高亮片段精度:不要直接对整篇文档的全文字段做高亮,在索引构建阶段将长文档按段落边界切分为200-300字的语义块,单独存入chunk_content字段,检索时直接命中对应语义块,返回的高亮片段就是精准匹配的内容段,不会出现无关内容。

零额外成本实现问答效果(无QnA Maker、无付费语义搜索)

  • 用基础版自带的向量检索能力搭建轻量混合检索链路,不需要额外购买付费服务:索引阶段沿用上述语义块切分逻辑,本地部署开源轻量向量模型bge-small-zh-v1.5(模型体积约100MB,可运行在Azure免费层App Service上,几乎无额外成本)为每个语义块生成向量,存入搜索服务的向量字段,该功能在Azure Cognitive Search基础定价层即可使用,不需要开通语义搜索配额。
  • 检索阶段执行混合召回:同时执行关键词全文检索和向量相似度检索,各召回Top20匹配语义块,对结果去重后按匹配分数加权排序,排在首位的语义块即为对应答案内容,通用场景下匹配精度和付费语义搜索差距小于10%,完全满足普通问答需求,全程不需要对接QnA Maker。
  • 若需要直接返回短句答案而非整段内容,可在排序后取Top3匹配块,用本地部署的开源小参数模型(如Qwen-1.8B)做答案抽取,不需要调用云端付费大模型。

检索结果返回PDF内对应关联图片

  • 该能力可通过原生索引器配置实现:配置Blob Storage索引器时,将imageAction参数设置为generateNormalizedImages,索引器解析PDF过程中会自动提取文档内所有图片,标准化后存入normalized_images字段,同时记录每张图片对应的原文档页码、相邻上下文文本信息。
  • 做内容和图片的绑定关联:语义块切分阶段,将每个语义块和其前后相邻段落范围内的图片做绑定,关联关系存入语义块的related_images字段;当检索命中"如何制作橙汁"对应的语义块时,直接返回绑定的图片内容即可。
  • 若需要提升图片匹配精度,可在图片提取阶段用开源OCR工具识别图片内文字,配合轻量图片打标模型生成图片内容描述,将识别结果和描述一并存入索引,检索时可直接匹配图片内容,不单纯依赖文本位置关联。

内容的提问来源于stack exchange,提问作者userbin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.31 23:36:37