寻求适用于工作站与HPC的embarrassingly parallel代码部署最优方案
寻找通用简便的易并行代码运行方案
核心需求
- 可在无PBS的工作站及带PBS的HPC多节点运行,改动最小
- 需运行100-1000个实例,单个实例最长运行8小时
- 各实例间无需通信
- 单个NUMA节点资源充足时可运行多实例,代码多为单线程(难改多线程),包含调用BLAS的线程化部分
- 实例的核心/内存需绑定到NUMA节点
- 并行数受内存限制,需据此计算分配每个实例的核心数
背景信息
代码为Fortran编写,支持命令行输入,可按需修改。
现有候选方案
- 自行编写sh脚本:当前工作站正在使用,原用
xargs后改为后台任务+while循环管理,效果好但难以扩展到多节点 - MPI:直接用Fortran实现或用Python包装器,例如通过
--map-by ppr:4:numa:pe=2参数按NUMA配置分配进程与线程,由MPI调度任务 - 其他方案?
内容的提问来源于stack exchange,提问作者js1
相关产品推荐
相关产品推荐

