You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Jetson Nano运行TensorRT模型时单帧耗时随推理帧数降低问题咨询

现象原因分析
  • Jetson平台动态调频机制的影响
    Jetson Nano默认启用动态功耗调节策略,CPU、GPU、CUDA核心的运行频率会随负载动态调整。当推理帧数较少时,负载持续时间过短,硬件核心还未拉升到最高额定频率推理就已完成,平均耗时自然偏高;随着推理帧数增加,核心持续处于高负载状态,稳定运行在最高频率下,单帧耗时随之下降。你可以执行sudo jetson_clocks命令锁定硬件最高频率后复测,小帧数的单帧耗时会明显降低,不同帧数量级的耗时差会大幅缩小。

  • TensorRT运行时懒加载开销摊薄
    即使排除了前15次的模型初始化耗时,TensorRT仍存在算子内核懒加载、CUDA资源绑定、显存/内存页锁定等延迟初始化逻辑,这些开销只会在对应资源首次被调用时产生,当推理规模足够大、所有依赖资源全部加载完成后,这部分一次性开销会被大量推理帧分摊,单帧平均耗时就会趋近于真实推理耗时。

  • 测试逻辑固定开销的占比变化
    你代码中time.time()包裹的计时范围包含了get_img_tensor()图像预处理、.numpy()设备到主机的数据拷贝、列表追加等操作,这些操作存在固定的函数调用、IO调度开销。当总帧数很少时,固定开销占总耗时的比例极高;当总帧数足够大时,固定开销被大量帧分摊,单帧平均耗时的统计结果就会更贴近纯模型推理的真实性能,你测试得到的10万帧下60FPS就是该模型在当前设备上的真实性能水平。

  • CUDA异步流水线填充效应
    CUDA推理任务是异步提交到GPU队列执行的,少量帧推理时,CUDA流水线还未被完全填满,GPU存在空闲等待周期;随着推理任务持续批量提交,GPU流水线被完全占满,硬件利用率拉满后,单位时间处理的帧数就会达到峰值。

内容的提问来源于stack exchange,提问作者p51pro

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.07 07:09:03