You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在OpenVINO Workbench中选择特定层进行INT8量化并保留部分层精度?

选择性量化ONNX模型的实现方法

一、指定量化/跳过量化的特定层

  • 精准指定层名称:先用Netron工具打开ONNX模型,查看所有层的名称,定位最后几层全连接层的准确名称。然后根据你使用的量化工具的配置规则,将这些层名加入忽略列表。比如使用OpenVINO POT工具时,在量化配置文件中设置ignored_layer_names参数,填入目标层名即可。
  • 按层类型筛选(谨慎使用):若最后几层全连接层的类型统一(如FullyConnected或MatMul),可直接设置跳过该类型的层。但要注意,如果模型其他位置存在同类型层,会被一并跳过,因此优先推荐按层名称指定。
  • 拆分模型后拼接:如果工具的忽略参数受限,可将模型拆分为两部分——需要量化的前端部分和保留精度的全连接后端部分。分别处理后,再将两部分重新拼接为完整的ONNX模型。

二、OpenVINO Workbench的对应功能

OpenVINO Workbench支持类似NNCF ignored_scopes的功能,具体操作如下:

  • 在INT8量化的配置流程中,进入高级设置选项,找到忽略层的配置项。
  • 你可以直接输入需要保留精度的全连接层名称,也可以通过Workbench内置的模型可视化界面,直接勾选目标层添加到忽略列表。
  • 确认配置后,工具会对未被忽略的层执行INT8量化,而勾选的全连接层将保持原有的FP32/FP16精度。

内容的提问来源于stack exchange,提问作者Anvar Ganiev

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 23:45:35