为何Clang处理double求绝对值时生成vandps而非GCC用的vandpd指令?
为何Clang将
fabs(double)编译为vandps而非GCC采用的vandpd? 测试代码如下:
#include <math.h> double float_abs(double x) { return fabs(x); }
clang 12.0.1 编译参数 -std=gnu++11 -Wall -O3 -march=znver3
.LCPI0_0: .quad 0x7fffffffffffffff # double NaN .quad 0x7fffffffffffffff # double NaN float_abs(double): # @float_abs(double) vandps xmm0, xmm0, xmmword ptr [rip + .LCPI0_0] ret
gcc 11.2 编译参数 -std=gnu++11 -Wall -O3 -march=znver3
float_abs(double): vandpd xmm0, xmm0, XMMWORD PTR .LC0[rip] ret .LC0: .long -1 .long 2147483647 .long 0 .long 0
核心原因非常简单:vandps和vandpd执行的128位按位与操作的结果完全一致,二者的差异仅在于指令设计时对应的浮点语义标识,对纯按位运算没有任何影响。
x86指令集中ps后缀代表打包单精度浮点数,pd后缀代表打包双精度浮点数,但对于按位逻辑运算来说,CPU不会解析操作数的浮点类型,只会单纯对128位寄存器的每一位执行与操作,所以只要掩码正确,用哪个指令的运算结果完全相同。
两个编译器选择不同指令只是代码生成策略的差异,不存在对错之分:
- Clang的逻辑更偏向简化指令选择:只要运算结果正确,优先选择通用的向量逻辑指令,不会特意匹配原数据的浮点类型,在Zen3架构上
vandps和vandpd的延迟、吞吐量、解码开销完全一致,不会带来任何性能损失。 - GCC的逻辑更偏向匹配原数据类型:由于输入是
double类型,所以默认选择对应双精度的pd后缀指令,属于编译器的风格偏好。
你观察到的常量定义差异也和两种策略对应:
Clang的常量是全128位的掩码,会同时清空xmm寄存器高低64位的符号位,由于返回值仅使用xmm0的低64位,高64位的操作不影响最终结果。GCC的常量仅低64位是正确的double符号位掩码,高64位为0,同样不会影响返回结果。两种实现的运行效果完全一致。
内容的提问来源于stack exchange,提问作者soc
相关产品推荐
相关产品推荐

