You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Ampere架构下CUDA __reduce_add_sync指令延迟查询

__reduce_add_sync在Ampere架构下的延迟情况

目前没有公开可查的、经过确认的__reduce_add_sync指令在Ampere架构下的具体延迟数值,相关信息如下:

  • CUDA官方编程指南仅给出了该指令在Ampere及后续微架构下的吞吐量为16,未提及延迟参数。
  • 社区讨论中虽涉及同类型warp指令(如_shfl系列)的延迟相关话题,但并未提供__reduce_add_sync的具体延迟数据。

内容的提问来源于stack exchange,提问作者Gal Avineri

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.11 10:34:52