You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Chroma向量数据库无法删除,遇文件占用权限错误求解决

解决Chroma向量数据库文件占用导致无法删除的问题

问题背景

开发了一个PDF上传处理项目,用户上传PDF后会创建Chroma向量数据库并返回结果。但上传第二个PDF时,系统尝试删除现有向量库创建新库时,持续报错:PermissionError: [WinError 32] 进程无法访问文件,因为另一个进程正在使用它。调研发现Chroma无内置关闭/删除向量库的函数,尝试强制删除、psutil终止进程均无效。

核心原因

Chroma(默认基于SQLite)的实例会保持对数据库文件的句柄引用,即使函数执行完毕,Python垃圾回收可能未及时释放资源,导致文件被锁定无法删除。

解决方案

1. 为每个请求使用独立临时向量库目录(推荐)

不再复用固定的PERSIST_DIR,每次处理请求时创建唯一临时目录,处理完成后自动销毁,从根源避免文件占用。

修改process_pdf函数:

def process_pdf(pdf_path: str) -> str:
    # 加载PDF文档
    loader = PyPDFLoader(pdf_path)
    pages = loader.load()

    # 分割文档为 chunks
    splitter = RecursiveCharacterTextSplitter(
        chunk_size=200,  
        chunk_overlap=50  
    )
    chunks = splitter.split_documents(pages)

    # 使用临时目录存储向量库,with块结束后自动删除
    with tempfile.TemporaryDirectory() as temp_persist_dir:
        # 初始化嵌入模型和向量库
        embeddings = HuggingFaceEmbeddings(model_name="all-MiniLM-L6-v2")
        vectorstore = Chroma.from_documents(chunks, embeddings, persist_directory=temp_persist_dir)

        # 初始化检索器和LLM
        retriever = vectorstore.as_retriever(search_kwargs={"k": 1})
        llm = ChatOpenAI(
            model="gpt-4o",
            temperature=0.9,
            max_tokens=500,
            openai_api_key=OPENAI_API_KEY
        )

        # 创建提示模板和检索链
        template = """
        Act as an experienced document reviewer. Your task is to give a clear concise summary of the document.
        context: {context}
        input: {input}
        answer:
        """
        prompt = PromptTemplate.from_template(template)
        combine_docs_chain = create_stuff_documents_chain(llm, prompt)
        retrieval_chain = create_retrieval_chain(retriever, combine_docs_chain)

        # 生成摘要
        response_1 = retrieval_chain.invoke({"input": "Give me summary of the document."})

    # 生成唯一文件名并保存结果
    base_filename = "Output"
    file_number = 1
    while os.path.exists(f"{OUTPUT_DIR}/{base_filename}_{file_number}.txt"):
        file_number += 1
    filename = f"{OUTPUT_DIR}/{base_filename}_{file_number}.txt"
    
    with open(filename, "w", encoding="utf-8") as file:
        file.write("Output:\n\n")
        file.write("Summary:\n")
        file.write(response_1["answer"] + "\n\n")
    return filename  

2. 显式释放Chroma资源并触发垃圾回收

如果必须复用固定目录,可在处理完成后显式清空Chroma数据、删除实例并强制垃圾回收,释放文件句柄。

添加资源释放代码到process_pdf函数末尾:

import gc

def process_pdf(pdf_path: str) -> str:
    # 原有代码(加载PDF、创建向量库、生成摘要等)...
    
    # 释放Chroma资源
    vectorstore._client.reset()  # 清空数据库内容
    del vectorstore  # 删除实例引用
    gc.collect()  # 强制触发垃圾回收
    
    # 保存结果代码...
    return filename

3. 延迟删除+重试机制

针对固定目录场景,添加重试逻辑,给系统足够时间释放文件锁:

import shutil
import time
from tenacity import retry, stop_after_attempt, wait_fixed

# 带重试的删除函数
@retry(stop=stop_after_attempt(3), wait=wait_fixed(2))
def delete_vector_db(dir_path):
    if os.path.exists(dir_path):
        shutil.rmtree(dir_path)
    os.makedirs(dir_path)

def process_pdf(pdf_path: str) -> str:
    # 替换原有删除逻辑
    delete_vector_db(PERSIST_DIR)
    
    # 原有代码...
    return filename

注意:需先安装tenacity库:pip install tenacity

4. 确保PyPDFLoader资源释放

PDF加载器也可能持有文件句柄,加载完成后显式删除实例并回收:

loader = PyPDFLoader(pdf_path)
pages = loader.load()
del loader  # 删除加载器实例
gc.collect()

总结

优先选择方案1(临时目录),无需依赖垃圾回收或重试,稳定性最高,彻底避免文件占用冲突。若必须复用固定目录,方案2是最直接的资源释放方式。

内容的提问来源于stack exchange,提问作者Aachal Gupta

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 09:07:02