如何在不退出Python的情况下清除PyTorch占用的全部GPU内存?
解决PyTorch多次运行模型GPU内存泄漏问题
用子进程隔离每次运行
这是最靠谱的方案,Python进程结束时会自动释放所有关联的GPU内存,彻底避免残留。把每次模型调用封装到独立子进程里,示例代码:import multiprocessing def run_single_model(config): # 这里写入第三方模型的完整调用逻辑:加载模型、传入配置、执行推理等 import torch # ... 第三方代码的具体实现 ... if __name__ == "__main__": # 你的不同配置列表 task_configs = [{"param1": val1}, {"param1": val2}, {"param1": val3}] for cfg in task_configs: proc = multiprocessing.Process(target=run_single_model, args=(cfg,)) proc.start() proc.join() # 等待子进程执行完毕,自动释放该进程占用的所有GPU内存配合垃圾回收强制释放内存
如果不想改进程结构,每次运行结束后先删除能拿到的模型、张量对象,再手动触发Python垃圾回收,最后清空CUDA缓存:import gc import torch # 每次模型运行结束后执行: del model, inference_outputs # 替换成你实际用到的模型/张量变量名 gc.collect() torch.cuda.empty_cache()但这种方法有局限性,如果第三方代码里有隐藏的全局引用(比如把张量存在了全局列表里),你没法手动删除,还是会有内存残留。
定位第三方代码的泄漏点
可以用PyTorch自带的内存工具排查残留张量:# 运行完一次模型后打印内存详情 print(torch.cuda.memory_summary(abbreviated=False)) # 或者生成内存快照,更细致地查看张量分布 snapshot = torch.cuda.memory_snapshot()从输出里找未被释放的大张量,看看第三方代码是不是把它们存在了全局容器里没清空,找到后在每次运行结束时手动清空这些容器。
内容的提问来源于stack exchange,提问作者Nagabhushan S N
相关产品推荐
相关产品推荐

