You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure AI Search混合语义搜索得分过低问题排查求助

混合语义搜索得分过低的原因分析

问题背景

  • 创建了包含向量字段与语义配置的Azure AI Search索引,索引内共30个文档
  • 目标文档标题与查询语句完全一致,普通全文搜索得分为13分,但混合语义搜索时该文档虽排名第一,得分却远低于4分的RAG阈值
  • 混合搜索代码同时启用了向量查询(匹配ContentVector和TitleVector)与语义搜索配置

核心原因拆解

1. 多维度得分的加权逻辑

Azure AI Search的混合搜索中,向量相似度得分(0-1区间的小数)与全文/语义得分(绝对值)是分开计算后再加权合并的。如果未显式调整权重,向量得分的占比会被绝对值较大的全文得分稀释,最终合并总分远低于纯全文搜索的得分。

2. 多向量字段的查询冲突

你的查询同时针对ContentVector和TitleVector两个向量字段:

  • 查询语句是完整标题,与TitleVector的相似度极高,但ContentVector基于长文本生成,和短标题查询的相似度偏低
  • 多向量字段查询时,Azure Search默认会取多个向量得分的最小值或平均值,直接拉低整体向量得分,进而影响混合搜索的最终得分

3. 语义搜索的得分机制

语义搜索的得分(0-4分制)是在向量/全文搜索返回的候选集上重新排序,不会直接叠加原始的BM25得分。如果混合搜索中语义得分的权重配置不合理,或者候选集筛选逻辑导致高BM25得分的文档在向量环节被拉低,最终总分就会偏低。

4. 嵌入模型的一致性问题

若生成查询嵌入的模型,与生成TitleVector/ContentVector的模型不一致(包括模型版本、维度ModelDimensions),向量相似度会大幅降低,直接导致向量得分极低。另外,长文本嵌入(ContentVector)与短查询嵌入的相似度本身就低于短标题与短查询的相似度,也会拉低整体向量得分。

优化建议

  • 调整向量查询字段:仅针对TitleVector查询(因查询语句为标题),或给不同向量字段设置权重(如TitleVector权重设为2,ContentVector设为1)
  • 显式配置混合搜索权重:在SearchOptions中设置HybridSearchBoost,或通过VectorQuery的Boost参数提升向量得分的占比
  • 拆分查看各维度得分:在返回结果中查看@search.score(混合得分)、@search.vectorScore(向量得分)、@search.semanticScore(语义得分),定位拉低总分的具体环节
  • 验证嵌入模型一致性:确保查询嵌入与文档嵌入使用同一模型、相同维度,避免向量不匹配

内容的提问来源于stack exchange,提问作者JamesP

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.04 18:42:58