为何GCC -ftree-partial-pre生成更多汇编却运行更快?
GCC 12.2下选择排序实现的优化异常现象解析
我在计算机课程中实现选择排序时,遇到了GCC 12.2版本的一个特殊优化案例:
实现了两个选择排序变体:
selection_sort:遍历过程中存储当前最小值的值selection_nostore_sort:仅存储当前最小值的索引,比较阶段需要直接访问数组元素
不同编译选项下的性能表现:
- 使用
-O2编译时,selection_nostore_sort因额外的数组访问操作,运行速度慢于selection_sort - 使用
-O3编译时,selection_nostore_sort反而比selection_sort快约10%(本地i7-10750H处理器及基准测试平台均验证此结果) - 进一步测试发现,仅在
-O2基础上添加-ftree-partial-pre优化选项,就能复现-O3下的性能反转效果
- 使用
汇编代码对比:启用
-ftree-partial-pre后生成的汇编代码量更多,但运行效率反而更高,无法通过指令数量直接解释性能差异,希望了解该现象的底层原因。
内容的提问来源于stack exchange,提问作者merlinio2000
相关产品推荐
相关产品推荐

