You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PTX(8.4)及CUDA 12.4是否支持小形状WMMA指令?Ampere GPU实操报错

Ampere GPU小形状FP16 WMMA指令的PTX支持说明
  • PTX层面不支持Ampere架构FP16精度的(16,8,16)小形状WMMA指令:CUDA 12.4的PTX ISA指南中,9.7.13.3节是FP16精度WMMA指令的具体规范,明确仅支持(16,16,16)、(32,8,16)、(8,32,16)三种形状;9.7.13.1节提到的小形状属于通用描述,并非针对FP16精度的实际支持范围。

  • 你调用的__hmma_m16n8k16_ld_a这类intrinsic未定义,是因为CUDA工具链没有为Ampere架构提供这类小形状FP16 WMMA的PTX级接口。对应的HMMA.16816.F16是SASS层面的指令,仅能通过直接嵌入SASS汇编的方式使用,无法通过PTX指令或官方intrinsic调用。

  • 补充:后续如Hopper等架构扩展了PTX对小形状WMMA的支持,但Ampere架构的PTX指令集未覆盖这类FP16小形状操作。

内容的提问来源于stack exchange,提问作者einpoklum

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.28 03:22:53