降低FLOPs与参数量若不为提升推理速度,还有哪些实际作用?
DenseNet低FLOPs优化的实际价值解答
你提到的困惑是深度学习部署领域非常典型的认知误区:FLOPs和参数量并不直接等价于推理速度,尤其在GPU这类高并行计算硬件上更是如此。
DenseNet推理速度偏慢的核心原因是它的密集连接设计需要频繁拼接不同层的特征图,带来了极高的内存访问开销(MAC)。现代GPU的计算速度远快于内存读写速度,大多数场景下推理瓶颈都在数据搬移而非计算量上,所以才会出现FLOPs低但实际运行速度慢的情况。
低参数量、低FLOPs的优化方向除了提速之外,还有非常多的实际应用价值:
- 低算力边端设备部署:很多嵌入式设备、IoT传感器、工业控制芯片没有GPU级别的并行加速能力,甚至只有百MHz级别的低主频CPU核心,这类设备上FLOPs和推理耗时几乎线性相关,低FLOPs的模型能正常运行,高FLOPs的模型根本无法部署。
- 能耗成本降低:不管是数据中心批量部署还是边端设备运行,计算、内存访问、参数存储都会产生功耗。同精度下低参数量低FLOPs的模型整体能耗要低得多,数据中心大规模部署时一年能省下百万级的电费成本,靠电池供电的边端设备(比如智能手表、野外监控)也能大幅提升续航时间。
- 训练与微调成本降低:参数效率高的模型训练时需要的显存、计算资源更少,收敛速度也更快,小团队用普通消费级显卡就能完成训练,不需要租赁昂贵的计算集群。下游任务微调时的开销也更低,适合需要频繁适配新场景的业务。
- 存储与传输成本优势:低参数量的模型本身占用的存储空间更小,很多端侧硬件的Flash存储空间只有几MB甚至几百KB,大模型根本放不下。如果需要给百万级的端侧设备推送模型更新,小模型的传输流量成本也会低一个数量级。
- 受限算力配额场景适配:手机、PC这类消费级设备上的AI功能不能占用全部硬件资源,需要给其他应用预留算力,低FLOPs的模型可以在限定的算力配额内流畅运行,不会造成设备卡顿。
内容的提问来源于stack exchange,提问作者ddd
相关产品推荐
相关产品推荐

