You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何Intel Core Ultra 7 268V能效核核间延迟更低?SPSC队列疑问

Intel Core Ultra 7 268V核间延迟分析与SPSC队列性能解答

测量结果

使用core-to-core-latency工具对Intel(R) Core(TM) Ultra 7 268V进行核间延迟测量,结果如下:

~/Developer/core-to-core-latency main
❯ cargo run -- --bench 1
    Finished `dev` profile [unoptimized + debuginfo] target(s) in 0.08s
     Running `target/debug/core-to-core-latency --bench 1`
CPU: Intel(R) Core(TM) Ultra 7 268V
Num cores: 8
Num iterations per samples: 1000
Num samples: 300

1) CAS latency on a single shared cache line

           0       1       2       3       4       5       6       7   
      0
      1  103±0 
      2   96±0    94±0 
      3   96±0    96±0    95±0 
      4  219±1   218±0   212±0   210±0 
      5  177±2   158±2   185±2   159±2    60±0 
      6  157±2   172±6   153±2   186±4    55±0    50±0 
      7  142±1   145±0   181±2   209±0    54±0    46±0    45±0 

    Min  latency: 45.3ns ±0.2 cores: (7,6)
    Max  latency: 218.9ns ±0.6 cores: (4,0)
    Mean latency: 134.8ns

CPU拓扑信息:

~/Developer/core-to-core-latency main
❯ lscpu -e                                       
CPU NODE SOCKET CORE L1d:L1i:L2:L3 ONLINE    MAXMHZ   MINMHZ       MHZ
  0    0      0    0 0:0:0:0          yes 4900.0000 400.0000  955.0980
  1    0      0    1 4:4:1:0          yes 4900.0000 400.0000 1400.4000
  2    0      0    2 8:8:2:0          yes 5000.0000 400.0000  667.1180
  3    0      0    3 12:12:3:0        yes 5000.0000 400.0000 1213.8459
  4    0      0    4 64:64:8          yes 3700.0000 400.0000 1100.0450
  5    0      0    5 66:66:8          yes 3700.0000 400.0000 1103.3210
  6    0      0    6 68:68:8          yes 3700.0000 400.0000  400.0000
  7    0      0    7 70:70:8          yes 3700.0000 400.0000  400.0000

测量显示4-7号能效核(E-core)间的通信延迟远低于0-3号性能核(P-core),以下是针对疑问的解答:


1. 为何能效核的核间延迟更低?

这是由Intel混合架构的缓存与互连设计决定的:

  • 缓存层级差异:从lscpu输出可见,4-7号E-core共享同一个L2缓存(编号为8),而0-3号P-core各自拥有独立的L2缓存。当E-core之间通过共享缓存行通信时,数据仅需在共享L2内迁移,无需经过更高层级的L3缓存;而P-core间通信需要先将数据从源核L2同步到L3,再加载到目标核L2,额外的缓存层级跳转带来了更高延迟。
  • 物理互连布局:E-core以集群形式紧凑布局,核间互连链路更短,信号传输的物理延迟更低;P-core为了追求单核性能,布局相对分散,核间互连路径更长,进一步拉高了通信延迟。
  • CAS测量特性:本次测试用的是CAS(比较并交换)操作,针对单个共享缓存行的竞争访问。E-core共享L2的设计让缓存行无需跨集群迁移,而P-core的独立L2导致缓存行需要在不同核的私有缓存间来回同步,延迟自然更高。

2. SPSC队列:性能核组 vs 能效核组,哪组吞吐量更高?

吞吐量的高低取决于工作负载特性,核心权衡点是核间通信延迟与单核处理能力:

  • 通信密集型负载(小消息、高频生产消费):能效核组的吞吐量会更高。SPSC队列的核心开销是缓存行的同步与迁移,E-core的低核间延迟+共享L2的高缓存命中率,能大幅降低每次生产/消费的通信开销,高频次操作下累计优势明显。
  • 计算密集型负载(大消息、每个消息需大量处理):性能核组的吞吐量更优。P-core拥有更高的主频(最高5GHz vs E-core的3.7GHz),单核计算能力更强,即使核间通信延迟高,但如果每个消息的处理耗时远超过通信延迟,P-core的计算优势会抵消通信劣势,整体吞吐量更高。
  • 建议:如果无法确定负载类型,最好针对实际业务场景做基准测试——比如用成熟的SPSC队列实现(如无锁环形缓冲区)分别在两组核上跑压测,对比单位时间内的消息处理量。

内容的提问来源于stack exchange,提问作者weineng

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.13 08:40:58