咨询:在Azure生态中查找Cosmos DB内Top5相似描述记录的最优服务
适用于Cosmos DB文本相似性检索的Azure服务推荐
1. Azure Cognitive Search
- 核心能力:支持与Cosmos DB直接集成,可将Cosmos DB中的数据同步至搜索索引,结合向量检索功能实现文本相似性匹配。
- 实现方式:
- 可利用内置文本嵌入模型,或对接Azure OpenAI的嵌入模型(如text-embedding-ada-002),为每条记录的描述生成向量并存储到搜索索引中。
- 给定目标记录的描述时,先将其转换为向量,再通过搜索服务的向量查询接口,返回相似度最高的Top5记录。
- 优势:支持大规模数据的高效检索,可配置评分规则、过滤条件,同时兼容全文检索与向量检索的混合查询,适合数据量大、需要复杂检索逻辑的场景。
2. Azure OpenAI 嵌入模型 + Cosmos DB 向量存储
- 核心能力:借助Azure OpenAI生成文本嵌入向量,结合Cosmos DB原生的向量存储与查询功能,直接在Cosmos DB内完成相似性检索。
- 实现方式:
- 预先为Cosmos DB中每条记录的描述字段生成嵌入向量,存储为文档的向量属性(如
descriptionVector)。 - 对于目标记录的描述,先调用Azure OpenAI生成对应的向量,再使用Cosmos DB的向量查询语法(如
SELECT TOP 5 * FROM c ORDER BY VECTOR_DISTANCE(c.descriptionVector, @targetVector) ASC,距离越小相似度越高)直接查询出Top5相似记录。
- 预先为Cosmos DB中每条记录的描述字段生成嵌入向量,存储为文档的向量属性(如
- 优势:无需额外搭建搜索服务,数据存储与查询闭环在Cosmos DB内完成,部署成本低,适合数据规模中等、架构简洁的场景。
为什么Text Analytics不适用?
Text Analytics聚焦于文本分析类任务(如实体识别、情感分析、关键词提取等),没有提供向量存储、相似性检索的核心能力,无法直接满足“查找Top5相似记录”的需求。
内容的提问来源于stack exchange,提问作者Azure Developer
相关产品推荐
相关产品推荐

