You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于Azure Cognitive Search提取相关文本的方法咨询

实现Azure Cognitive Search返回SharePoint文档相关子段落并对接OpenAI的方案

方案1:利用Azure Cognitive Search语义检索的片段提取功能

Azure Cognitive Search标准版支持语义检索的高亮片段提取,可直接返回与查询相关的子段落,无需额外拆分文档:

  • 索引配置检查:确保存储文档内容的字段(如content)已设置为searchable,且在语义配置中被标记为语义字段(Semantic Field)。
  • 调整查询参数:调用Search API时使用以下关键参数:
    • queryType=semantic:启用语义检索
    • highlight=content:指定要提取高亮片段的内容字段
    • select=id,title:仅返回需要的元数据(可选,减少返回数据量)
    • semanticConfiguration=<你的语义配置名称>:关联已配置的语义设置
    • highlightPreTag/highlightPostTag:自定义片段标记(如<match>),方便后续提取
  • 结果处理:从返回结果的@search.highlights.content字段中提取所有匹配的子段落,这些就是与问题最相关的文本片段,直接合并后输入OpenAI生成连贯回答。

方案2:段落级拆分+向量检索(进阶RAG方案)

如果语义片段提取无法满足精度需求,可通过段落拆分结合向量检索实现更精准的子段落匹配:

  • 文档预处理:通过Azure Function或自定义索引器逻辑,将SharePoint中的大文档按自然段落(如换行、标题分隔符)拆分为独立的小段落,每个段落作为索引的一条记录。
  • 向量字段配置:在Azure Cognitive Search索引中添加向量字段(类型为Collection(Edm.Single)),并配置向量检索策略(关联Azure OpenAI Embeddings模型)。
  • 混合检索:用户提问时,先将问题转换为Embedding,调用Azure Cognitive Search的混合检索(语义检索+向量检索),返回最相关的段落集合。
  • OpenAI调用:将筛选后的相关段落输入OpenAI,生成符合需求的连贯回答。

补充优化建议

  • 若使用语义回答功能,可设置answers=extractive并调整answerCount参数,直接提取与问题匹配的回答片段,提升返回内容的精准度。
  • 控制输入OpenAI的token总量:按段落相关性排序,仅选取前N个最相关的段落,避免超过模型token限制。
  • 确保查询语言与文档语言一致,通过queryLanguage参数指定(如zh-CN),提升语义检索的匹配效果。

内容的提问来源于stack exchange,提问作者Lee Simpson

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.04 00:40:42