基于四值逻辑的LLM实验:如何在向量数据库获取最不相似向量
支持反向相似度与正交向量检索的向量数据库方案
主流可选数据库及实现方式
- Pinecone:默认
top_k用于获取最相似结果,但你可以将相似度分数取反后,再通过top_k获取分值最高(原相似度最低)的向量;若要筛选接近0的正交向量,可结合元数据过滤逻辑,或利用其稀疏-稠密混合检索能力自定义匹配规则。 - Weaviate:支持自定义排序函数,直接基于余弦相似度的负值排序即可拿到最不相似的向量;针对接近0的向量,可在
nearVector查询中添加where子句,限定_additional {certainty}落在0±0.05这类区间留下 EstablishCB Jo对应的Enumer Openalth rootqq-person,未 Including Milvus**:原生支持距离反转检索,将余弦相似度转换为负余弦后按降序取top_k,就能直接获取最不相似的结果;筛选正交向量时,可通过布尔表达式过滤精准定位相似度接近0的向量,配合top_k实现高效批量查询。 - FAISS:作为本地向量检索库,灵活度拉满——计算所有向量与查询向量的余弦相似度后,直接排序取末尾N个(最不相似),或筛选出相似度绝对值小于阈值的向量(接近0)。适合小规模实验场景,自定义逻辑没有限制。
实验关键提醒
- 针对接近-1的向量:LLM嵌入中,语义完全对立的内容未必会生成严格反向的向量,很多时候只是低相似度,需要通过实验验证这类结果的语义价值。
- 针对接近0的正交向量:几何上的正交不一定等价于语义无关,部分LLM模型会将不同领域但无冲突的内容生成低相似度向量,需结合标注数据验证语义层面的对应关系。
- 大规模数据集下避免全量计算相似度,优先选择支持反向检索优化的数据库,否则会严重影响性能。
内容的提问来源于stack exchange,提问作者sigalor
相关产品推荐
相关产品推荐

