You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python Multiprocessing加速Pandas DataFrame行循环计算?

用Multiprocessing改写Pandas行遍历计算的实现方法

首先要明确:你的原代码场景其实用Pandas内置方法就能高效完成,比如:

result = np.column_stack([data.mean(axis=1), data.max(axis=1)])

这种方式比多进程更高效,因为多进程本身存在进程启动、数据传递的开销,只有当每行的计算逻辑非常复杂(比如耗时的模型推理、复杂数值运算)时,多进程才会带来明显的速度提升。

如果确实需要用Multiprocessing实现,改写代码如下:

import pandas as pd
import numpy as np
from multiprocessing import Pool

def process_row(row):
    # 封装单一行的计算逻辑,和原循环内操作一致
    return [np.mean(row), np.max(row)]

if __name__ == "__main__":
    data = pd.DataFrame([[1, 2],
                         [3, 4],
                         [5, 6]])
    
    # 将DataFrame的行转为可迭代的numpy数组列表,方便进程池处理
    rows = [row.values for _, row in data.iterrows()]
    
    # 创建进程池,默认使用当前机器的CPU核心数
    with Pool() as pool:
        # 并行分发任务,收集所有结果
        results = pool.map(process_row, rows)
    
    # 转换为和原代码格式一致的numpy数组
    result = np.array(results)
    print(result)

关键注意点:

  • 必须把主逻辑放在if __name__ == "__main__":代码块内,这是Windows系统多进程的强制要求,避免子进程重复执行主代码导致报错;Linux/macOS虽然不强制,但加上更规范。
  • process_row函数要保持独立,只负责单一行的计算,确保能被进程池正确调用。
  • 使用pool.map方法自动分发任务并收集结果,无需手动管理进程的启动和结束。

内容的提问来源于stack exchange,提问作者swissy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.22 23:45:43