You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何避免Chroma创建新检索器时重复计算嵌入向量?

复用已有嵌入向量创建新Chroma检索器的方案

实现步骤

  1. 整理过滤后的数据
    确保你已经从原ChromaDB中过滤得到以下对应长度一致的列表:

    • filtered_ids: 文档ID集合
    • filtered_documents: 文档内容集合
    • filtered_metadatas: 元数据集合
    • filtered_embeddings: 已计算好的嵌入向量集合
  2. 初始化空Chroma实例
    无需传入真实嵌入函数,用占位函数兼容部分版本的强制要求:

    from langchain.vectorstores import Chroma
    
    # 定义占位嵌入函数(不会被实际调用)
    def dummy_embed(texts):
        return []
    
    # 初始化空向量库,可指定持久化路径(内存模式可省略该参数)
    new_chroma = Chroma(
        embedding_function=dummy_embed,
        persist_directory="./filtered_chroma_db"
    )
    
  3. 批量导入已有数据
    调用add方法直接传入所有预存数据,跳过嵌入计算步骤:

    new_chroma.add(
        ids=filtered_ids,
        documents=filtered_documents,
        metadatas=filtered_metadatas,
        embeddings=filtered_embeddings
    )
    
    # 若指定了持久化路径,执行保存操作
    new_chroma.persist()
    
  4. 生成检索器
    直接从新Chroma实例生成检索器:

    retriever = new_chroma.as_retriever(search_kwargs={"k": 5})
    

核心原理

Chroma的add方法支持直接接收embeddings参数,当传入该参数时,会跳过嵌入函数的调用逻辑,直接使用提供的预计算向量数据,完全避免重复计算嵌入的开销。

内容的提问来源于stack exchange,提问作者kamal douma

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.10 04:46:01