运行时选择constexpr函数用于热循环的高性能实现方案问询
性能差异原因
run2性能低于run1的核心原因是:使用三元运算符选择mod_power2和mod时,两个函数会退化为同类型的函数指针,GCC 10.3无法对函数指针的调用做内联优化,导致循环中每次迭代都有一次间接函数调用开销,因此性能下降一倍。
而run1的两个分支中,lambda直接绑定了具体的函数调用,编译器可以完全内联模运算逻辑,循环内没有额外调用开销,性能更高。
优化实现方案
方案1:循环内判断(最简写法)
把判断逻辑放到lambda内部,不需要拆分visit调用,没有代码重复。现代编译器会自动将循环不变的判断逻辑提到循环外,同时内联两个模运算函数,性能和run1一致:
void run_opt1(const std::vector<int> &v1, int num_partitions, std::vector<int> &v2) { visit(v1, [&](size_t i, int v) { if (if_power2(num_partitions)) { v2[i] = mod_power2(v, num_partitions); } else { v2[i] = mod(v, num_partitions); } }); }
该方案可读性最高,适合GCC 11及以上、Clang全版本的编译环境。
方案2:模板分发(兼容性最佳)
如果需要兼容老版本GCC,可以通过模板helper封装公共逻辑,既保证没有代码重复,又完全和run1的性能一致:
template<bool is_power2> void run_impl(const std::vector<int>& v1, int num_partitions, std::vector<int>& v2) { visit(v1, [&](size_t i, int v) { if constexpr (is_power2) { v2[i] = mod_power2(v, num_partitions); } else { v2[i] = mod(v, num_partitions); } }); } void run_opt2(const std::vector<int>& v1, int num_partitions, std::vector<int>& v2) { if (if_power2(num_partitions)) { run_impl<true>(v1, num_partitions, v2); } else { run_impl<false>(v1, num_partitions, v2); } }
该方案通过编译期分支选择保证内联效果,在所有支持C17的编译器下都能达到和run1相同的性能。如果用C11的环境,把if constexpr换成普通if即可,老版本编译器也能正确优化。
内容的提问来源于stack exchange,提问作者n1r44
相关产品推荐
相关产品推荐

