Ampere架构下CUDA __reduce_add_sync指令延迟查询
__reduce_add_sync在Ampere架构下的延迟情况
目前没有公开可查的、经过确认的__reduce_add_sync指令在Ampere架构下的具体延迟数值,相关信息如下:
- CUDA官方编程指南仅给出了该指令在Ampere及后续微架构下的吞吐量为16,未提及延迟参数。
- 社区讨论中虽涉及同类型warp指令(如
_shfl系列)的延迟相关话题,但并未提供__reduce_add_sync的具体延迟数据。
内容的提问来源于stack exchange,提问作者Gal Avineri
相关产品推荐
相关产品推荐

