如何让Numba释放前一次CUDA内核执行占用的资源?
解决Numba CUDA连续执行两次内核的内存不足问题
核心问题在于第一次执行后,旧的设备内存对象(比如第一次用的输入、输出设备数组)仍占用GPU空间,未被及时释放,导致第二次复制数据时内存不足。单纯同步流只是等待操作完成,不会主动释放内存;而重置上下文会销毁所有CUDA资源(包括已编译的内核句柄),这就是第二次启动内核报无效句柄错误的原因。
正确操作步骤
- 确保第一次执行的所有操作完全完成:
stream.synchronize() # 等待当前流内的所有操作结束 cuda.synchronize() # 等待所有CUDA操作执行完毕 - 显式删除不再需要的设备变量:
# 删除第一次执行用到的设备对象,比如device_input、device_results等 del device_input, device_results - 强制触发Numba的设备内存垃圾回收:
cuda.device_memory().gc() - 之后正常执行第二次的数据复制与内核启动:
# 第二次数据复制到GPU device_largest_vals = cuda.to_device(largest_vals, stream=stream) # 启动第二次内核 your_kernel[blocks, threads, stream](device_largest_vals, ...)
补充说明
- Numba的设备内存管理依赖Python垃圾回收,但垃圾回收不会总是立刻触发,显式调用
cuda.device_memory().gc()能强制释放无引用的设备内存。 - 绝对不要用
cuda.current_context().reset(),除非你打算彻底销毁当前上下文的所有资源——这会让之前编译的内核、分配的设备内存全部失效,直接导致第二次内核启动失败。
内容的提问来源于stack exchange,提问作者Edy Bourne
相关产品推荐
相关产品推荐

