Intel XEON Gold处理器共享内存访问延迟过高优化方案咨询
降低共享内存访问延迟测量值的优化方案
- 修正RDTSC计时逻辑
现有rdtsc指令未加序列化屏障,会被CPU乱序执行导致计时误差,同时未扣除rdtsc本身的执行开销。可以修改计时函数:- 在
rdtsc前添加lfence指令保证指令序列化,或者直接使用带序列化功能的rdtscp指令 - 预先多次调用计时函数测算其本身的开销,最终结果扣除该固定开销
- 开启Intel处理器的恒定TSC功能(Xeon Gold默认支持),避免CPU变频导致的时钟计数不准
- 在
- 消除缺页异常开销
第一个线程测得的0x6312明显是首次访问共享内存触发缺页异常导致的。可以在mmap参数中添加MAP_POPULATE标志,让系统在映射阶段就完成所有页表创建和物理页分配,避免运行时触发缺页。也可以直接使用大页(2M/1G巨页)分配共享内存,进一步降低页表遍历开销。 - 解决缓存一致性竞争
现有代码所有线程都写入同一块共享内存地址,每次写入都会触发缓存一致性协议的RFO(读所有权)操作,需要失效其他核心上的对应缓存行,带来额外开销。优化方案:- 每个线程使用独立的内存地址,地址之间偏移至少64字节(Xeon处理器缓存行大小),避免真共享和伪共享
- 如果是测量核间通信延迟,应该用乒乓测试逻辑:核心1写,核心2读确认后再写,避免多个核心同时争抢同一块地址
- 修复代码本身的bug
现有代码存在两处明显问题会引入额外误差:- 所有线程共用同一个
struct thread_info实例,循环修改core_id时会出现数据竞争,导致线程参数读取错误 - 未定义
lock变量就调用pthread_mutex_init,会引发未定义行为
- 所有线程共用同一个
- 降低系统干扰
- 给测试线程设置实时调度策略(
SCHED_FIFO/SCHED_RR)和高优先级,避免被其他系统进程抢占打断计时 - 绑定测试核心时避开CPU0(通常负责处理大量系统中断),同时保证所有测试核心和共享内存位于同一个NUMA节点,避免跨NUMA访问带来的额外延迟
- 给测试线程设置实时调度策略(
- 优化测试逻辑
- 正式计时前先做预热:预先执行几次内存写入和计时操作,让指令和数据都进入缓存,避免冷启动开销
- 不要单次测试就输出结果,重复测试上千次取平均值,排除中断、调度等偶然因素的干扰
- 如果要测量纯内存访问延迟,不要用
memcpy,直接对volatile修饰的地址做单次写入/读取操作,消除memcpy本身的函数调用和循环开销
内容的提问来源于stack exchange,提问作者Swati Kunwar
相关产品推荐
相关产品推荐

