You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Nsight Systems/Compute获取CUDA内核Bar的平均执行时间?

获取CUDA内核Bar的平均执行时间汇总(Nsight Compute/Nsight Systems)

Nsight Compute 方法

CLI方式

  • 直接给nv-nsight-cu-cli加上-s(或全称--statistics)参数,就能自动生成内核调用的汇总统计:
    nv-nsight-cu-cli -k Bar -s Foo
    
    执行后会输出Bar内核100次调用的平均、最大、最小执行时间,以及总调用次数、总耗时等汇总数据,不用再逐条查看单次执行结果。
  • 如果需要导出数据做后续分析,可追加--csv参数输出为CSV格式:
    nv-nsight-cu-cli -k Bar -s --csv Foo > bar_kernel_stats.csv
    

GUI方式

  • 打开Nsight Compute,选择「Profile Application」,指定Foo的路径,在「Kernel Filter」输入框中填入Bar,启动性能分析。
  • 分析完成后,切换到左侧导航栏的「Statistics」标签页,这里会直接展示Bar内核所有调用的汇总数据,包括平均执行时间、调用次数、总耗时等核心指标。

Nsight Systems 方法

CLI方式

  • 先采集内核运行数据:
    nsys profile -k "Bar" -o bar_profile Foo
    
    执行后会生成名为bar_profile.nsys-rep的采集文件。
  • 基于采集文件生成汇总统计:
    nsys stats --report gpukernsum bar_profile.nsys-rep
    
    这份报告里会明确列出Bar内核的调用次数、平均执行时间、总耗时等汇总信息。
  • 也可以一步到位,采集时直接生成统计结果:
    nsys profile -k "Bar" --stats=true -o bar_profile Foo
    

GUI方式

  • 打开Nsight Systems,点击「Profile a Process」,选择Foo应用,在「Filter」选项中勾选「CUDA Kernels」并指定名称为Bar,启动性能分析。
  • 采集完成后,点击界面上方「Reports」菜单,选择「GPU Kernel Summary」,这份报告将展示Bar内核的调用汇总数据,包括平均执行时长、调用次数等关键信息。

内容的提问来源于stack exchange,提问作者Tyson Hilmer

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 09:47:16