跨服务器RTX 6000 Ada GPU基于ConnectX-6 RDMA直连传输问题问询
RDMA+InfiniBand跨服务器GPU直连问题解答
问题1:处于NODE连接类型时,是否仍可实现GPU间的RDMA直连传输?
可以实现传输,但无法绕开CPU/系统内存中转,达不到你预期的低延迟目标:
nvidia-smi topo -m显示的NODE类型,代表GPU与网卡之间没有直接PCIe链路,数据必须通过系统主存(Root Complex)中转。- 此时的RDMA流程为:发送端GPU → 系统主存 → ConnectX-6网卡 → 网络 → 接收端网卡 → 系统主存 → 接收端GPU。全程需经过主存拷贝,延迟和带宽都会受NODE连接限制,性能远不如GPU与网卡直接PCIe连接的场景。
问题2:nvidia-peermem内核模块未正确启用是否会影响该传输?
会直接影响,甚至可能是导致你当前接收端无数据的核心原因:
- nvidia-peermem的作用是让RDMA设备(如ConnectX-6)能够直接访问GPU内存,支持GPU与RDMA设备间的Peer-to-Peer(P2P)内存操作。
- 即便处于NODE连接类型,若未启用该模块,你无法将GPU内存直接注册为RDMA的内存区域(MR)。如果你的脚本直接用CuPy分配的GPU缓冲区做RDMA收发,会因内存注册失败导致数据无法正确送达接收端GPU缓冲区;这种情况下你只能先将GPU数据拷贝到CPU内存,再注册为RDMA缓冲区传输,完全绕不开CPU中转。
内容的提问来源于stack exchange,提问作者Alba Delgado
相关产品推荐
相关产品推荐

