You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python类中大型数组的多进程内存占用问题

问题分析与解答

核心原因:多进程启动机制与代码结构的影响

你的代码存在关键的潜在问题,结合Python多进程的不同启动逻辑,直接导致了内存远超预期的现象:

1. 两种多进程启动方式的本质差异

Python multiprocessing.Pool 主要有两种启动模式:

  • fork(Unix/Linux默认):子进程直接复制父进程的地址空间,但采用**写时复制(COW)**机制——只有当父/子进程对某段内存执行写操作时,才会真正复制对应内存页。如果所有进程都只读访问arr,理论上内存只会保留1份arr的副本,仅附加少量进程开销。
  • spawn(Windows默认,也可手动指定):子进程会重新启动Python解释器,从头执行脚本代码。此时,if __name__ == "__main__" 以外的代码会被所有子进程执行。

2. 代码结构触发了多份arr的重复创建

看你的代码:

s = example()  # 这行在if __name__ == "__main__"代码块外

if __name__ == "__main__":
    with Pool(8) as po:
        x = po.map(s.f, range(100))

如果使用spawn启动方式,每个子进程都会执行s = example(),创建独立的example实例,每个实例都会生成自己的1000×1000×1000×1000的numpy数组。8个工作进程就会产生8份完全独立的arr,再加上父进程的1份,总内存占用接近9倍单份arr的大小,这就是你看到内存远超预期的直接原因。

即使是fork方式,也可能因为隐性写操作触发COW复制(比如子进程访问实例时修改Python对象的引用计数),但只会复制小内存页,不会导致内存占用大幅飙升。

3. 验证与修复方案

  • 查看当前启动方式:可以在代码中添加print(multiprocessing.get_start_method())确认默认启动模式。
  • 修复代码结构:将实例创建移到if __name__ == "__main__"块内:
    import numpy as np
    from multiprocessing import Pool
    
    class example:
        def __init__(self):
            self.arr = np.random.rand(1000, 1000, 1000, 1000)
    
        def f(self, a):
            return self.arr[0, 1, 2, 3] * a
    
    if __name__ == "__main__":
        s = example()  # 移到此处
        with Pool(8) as po:
            x = po.map(s.f, range(100))
    
    这样在spawn方式下,子进程不会重复创建example实例,而是通过序列化接收父进程传递的实例(仅传递必要数据,不会重新生成arr);fork方式下依然保持COW的内存共享特性。

对两个疑问的明确回答

  1. 仅在fork启动+只读访问+代码结构正确的理想场景下,内存占用才主要是1份arr的大小,附加少量可忽略的开销。
  2. 不会达到arr的100倍,但如果是spawn启动且代码结构错误,会达到进程数+1倍的arr大小,远大于单份内存。

内容的提问来源于stack exchange,提问作者John

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.29 10:33:11