You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为什么Python multiprocessing的apply、map方法运行时永久挂起?

根本原因
  • 进程启动模式限制:Python 3.8+在Windows平台、Python 3.9+在macOS平台上,multiprocessing默认使用spawn模式创建子进程,该模式要求工作函数、全局变量必须在模块顶层可被导入。而Jupyter Notebook属于交互运行环境,子进程无法正确获取Notebook内定义的函数、全局数据,会陷入无限等待导致挂起。
  • 同步调用效率问题:你使用的pool.apply是同步阻塞方法,遍历20万行数据逐行调用时,完全没有并行效果,运行时间极长,会被误判为永久挂起。
解决方法
  • 添加入口保护:将所有多进程相关的执行代码包裹在if __name__ == '__main__'判断内,这是spawn模式的强制要求,避免子进程递归启动主模块。
  • 替换并行调用方法:将同步的apply替换为starmap(支持多参数传入)、apply_async等原生并行方法,充分利用多核性能。
  • Jupyter环境适配:可以安装第三方库multiprocess替换标准库multiprocessing,该库使用dill做序列化,支持交互环境下的函数传递,无需额外修改代码逻辑即可运行。
可运行代码示例
import multiprocessing as mp
import numpy as np

def howmany_within_range(row, minimum, maximum):
    """Returns how many numbers lie within `maximum` and `minimum` in a given `row`"""
    count = 0
    for n in row:
        if minimum <= n <= maximum:
            count = count + 1
    return count

if __name__ == '__main__':
    # 创建测试数据
    np.random.RandomState(100)
    arr = np.random.randint(0, 10, size=[200000, 5])
    data = arr.tolist()

    # 上下文管理器自动管理进程池生命周期
    with mp.Pool(mp.cpu_count()) as pool:
        # starmap会自动迭代参数列表,并行传入函数执行
        results = pool.starmap(howmany_within_range, [(row, 4, 8) for row in data])

    print(results[:10])

内容的提问来源于stack exchange,提问作者Alex

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 20:06:02