You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何f2py封装的dgemm小矩阵运算性能远低于numpy-einsum?

f2py封装dgemm小维度矩阵性能异常排查

我尝试用f2py封装Fortran中的dgemm函数,对比其与numpy-einsum的运算耗时,发现小维度矩阵下dgemm运算速度比numpy-einsum慢10倍左右(计时逻辑内置在Fortran代码中)。按常理纯Fortran实现的dgemm应该更快,对此差异我感到疑惑——毕竟numpy基于C封装,numpy和f2py理论上都会存在编译型语言的调用开销。

验证实验结果

  • 矩阵维度增大后性能反转:当n=1000时,dgemm运算速度远超numpy-einsum;
  • 将Fortran代码中的dgemm替换为matmul后,小维度矩阵运算速度大幅提升;
  • 纯Fortran环境下调用dgemm的小矩阵运算耗时远低于f2py封装后的情况;
  • 多次调用f2py封装的dgemm时,首次调用耗时远高于后续调用,scipy.linalg.blas.dgemm也存在类似首次调用开销;
  • 移除Fortran中的计时逻辑并使用显式维度后,性能表现恢复正常。

所有实验的运算结果均通过numpy.allclose验证一致。

内容的提问来源于stack exchange,提问作者Chungji

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 14:45:04