You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Intel UHD Graphics 620(iGPU)下OpenVINO推理慢于CPU的问题咨询

问题分析与优化建议

原因判断

这种iGPU推理耗时远高于CPU的现象,核心是Intel UHD Graphics 620的硬件性能限制,配置因素影响较小,具体原因如下:

  1. 硬件性能差距:UHD 620是第8代酷睿系列的入门级核显,仅配备24个执行单元,显存依赖系统内存共享,带宽有限。而CodeFormer基于Transformer架构,对并行计算能力和显存带宽要求较高,这种入门级iGPU的计算能力远不如同代的Intel Core i5-8250U(4核8线程,单核心性能优异,且OpenVINO对CPU的优化非常成熟)。
  2. FP16支持局限性:UHD 620对FP16精度的硬件加速支持有限,其FP16计算性能并没有比FP32有显著提升,甚至可能因为数据格式转换的额外开销,导致推理速度变慢。
  3. 单样本推理的iGPU劣势:iGPU的并行优势通常在批量推理时才能体现,单张图像推理时,iGPU的启动调度开销可能进一步放大性能差距。

性能优化建议

CPU方向优化(推荐,当前CPU性能更适配)

  • 启用多线程优化:在OpenVINO配置中设置num_streams为CPU_THROUGHPUT_AUTO,充分利用i5-8250U的4核8线程资源
  • 模型量化:使用OpenVINO的Post-Training Optimization Tool将模型转换为int8精度,进一步降低CPU推理的计算开销
  • 固定输入形状:确保推理输入的图像尺寸与模型最优输入尺寸完全匹配,避免动态形状带来的额外计算开销

iGPU方向优化(若必须使用iGPU)

  • 确认驱动兼容性:更新Intel Graphics Driver至适配OpenVINO 2024.3.0的最新版本,确保iGPU的硬件加速功能正常启用
  • 批量推理:尝试输入多张图像进行批量推理,利用iGPU的并行计算优势,抵消单样本的调度开销
  • 减少格式转换:确保输入数据直接以FP16格式传入模型,避免推理过程中的数据格式转换开销
  • 调整流配置:设置num_streams为GPU_THROUGHPUT_AUTO,让OpenVINO自动优化iGPU的推理流调度

通用优化步骤

  • 使用benchmark_app工具测试:运行OpenVINO自带的benchmark_app -m <模型路径> -d <设备>命令,排除代码中图像预处理、后处理等非推理环节的耗时干扰,得到精准的模型推理耗时
  • 环境校验:确认Python 3.10.0与OpenVINO 2024.3.0的依赖包版本兼容,避免因依赖问题导致的性能损耗

内容的提问来源于stack exchange,提问作者Prashant

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.19 00:37:34