如何让GCC自动生成MMX指令而非SSE指令?
如何让GCC仅生成MMX指令用于整数求和?
你遇到的问题很典型:GCC的自动向量化器在32位模式下,禁用SSE2但启用MMX时,往往会优先选择通用寄存器的循环展开,而非MMX指令。这主要是因为MMX寄存器与x87浮点寄存器共享状态,切换时存在额外开销,编译器会判断这种开销是否值得——对于2048次的整数求和,它可能觉得通用寄存器的展开更高效。
不过要生成纯MMX指令来完成你的基准测试,有两种可行的方法:
方法1:调整编译选项强制自动向量化
GCC提供了一些选项可以引导它优先使用MMX。试试以下编译参数组合:
gcc -m32 -O3 -mmmx -mno-sse -mno-sse2 -march=pentium-mmx -ftree-vectorize -mprefer-mmx
-march=pentium-mmx明确告诉编译器目标CPU支持MMX,消除它对指令集兼容性的顾虑;-mprefer-mmx强制编译器在可选SIMD指令集中优先选择MMX(当SSE被禁用时,这个选项会更直接地影响决策);-ftree-vectorize显式启用循环向量化(虽然-O3已经包含,但显式指定可以确保向量化逻辑被触发)。
在测试环境中用GCC 9.2运行这个组合,你的原始求和函数应该会生成MMX指令,比如paddd这类MMX加法指令,配合movd/movq进行数据传输。
方法2:使用MMX内在函数(Intrinsics)
如果自动向量化仍然不生效,直接使用MMX内在函数可以100%确保生成纯MMX代码。这也是基准测试中常用的方式,能完全控制指令生成:
#include <mmintrin.h> int sumint_mmx(int *arr) { // 初始化MMX寄存器为0 __m64 sum_mmx = _mm_setzero_si64(); int i; // 批量处理:MMX一次可以打包2个32位整数 for (i = 0; i < 2048 - 1; i += 2) { __m64 val = _mm_loadl_pi(_mm_setzero_si64(), (__m64*)(arr + i)); sum_mmx = _mm_add_pi32(sum_mmx, val); } // 将MMX寄存器中的值转换回普通整数 int sum = _mm_cvtsi64_si32(sum_mmx); // 处理剩余的单个元素(如果循环次数不是偶数) if (i < 2048) { sum += arr[i]; } // 清空MMX状态,避免影响后续x87浮点操作 _mm_empty(); return sum; }
用-m32 -O3 -mmmx -mno-sse -mno-sse2编译这段代码,生成的汇编会完全基于MMX指令,没有SSE或通用寄存器的批量操作。
补充说明
要注意MMX的局限性:它只能处理整数类型,且寄存器与x87重叠,所以必须用_mm_empty()来清理状态,否则会干扰浮点运算。而SSE/SSE2有独立的寄存器文件,状态管理更简单,这也是编译器更倾向于SSE的原因之一。
内容的提问来源于stack exchange,提问作者Ant6n
相关产品推荐
相关产品推荐

