You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在不退出Python的情况下清除PyTorch占用的全部GPU内存?

解决PyTorch多次运行模型GPU内存泄漏问题
  • 用子进程隔离每次运行
    这是最靠谱的方案,Python进程结束时会自动释放所有关联的GPU内存,彻底避免残留。把每次模型调用封装到独立子进程里,示例代码:

    import multiprocessing
    
    def run_single_model(config):
        # 这里写入第三方模型的完整调用逻辑:加载模型、传入配置、执行推理等
        import torch
        # ... 第三方代码的具体实现 ...
    
    if __name__ == "__main__":
        # 你的不同配置列表
        task_configs = [{"param1": val1}, {"param1": val2}, {"param1": val3}]
        for cfg in task_configs:
            proc = multiprocessing.Process(target=run_single_model, args=(cfg,))
            proc.start()
            proc.join()  # 等待子进程执行完毕,自动释放该进程占用的所有GPU内存
    
  • 配合垃圾回收强制释放内存
    如果不想改进程结构,每次运行结束后先删除能拿到的模型、张量对象,再手动触发Python垃圾回收,最后清空CUDA缓存:

    import gc
    import torch
    
    # 每次模型运行结束后执行:
    del model, inference_outputs  # 替换成你实际用到的模型/张量变量名
    gc.collect()
    torch.cuda.empty_cache()
    

    但这种方法有局限性,如果第三方代码里有隐藏的全局引用(比如把张量存在了全局列表里),你没法手动删除,还是会有内存残留。

  • 定位第三方代码的泄漏点
    可以用PyTorch自带的内存工具排查残留张量:

    # 运行完一次模型后打印内存详情
    print(torch.cuda.memory_summary(abbreviated=False))
    # 或者生成内存快照,更细致地查看张量分布
    snapshot = torch.cuda.memory_snapshot()
    

    从输出里找未被释放的大张量,看看第三方代码是不是把它们存在了全局容器里没清空,找到后在每次运行结束时手动清空这些容器。

内容的提问来源于stack exchange,提问作者Nagabhushan S N

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 10:22:21