You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

DPDK计算Mellanox ConnectX-6网卡RSS哈希值不匹配问题求助

复现Mellanox ConnectX-6 Dx网卡RSS哈希值以实现跨网卡负载均衡

我使用Mellanox ConnectX-6 Dx(型号MT2892 Family [ConnectX-6 Dx] 101d,网卡接口ens5f1,驱动mlx5_core)搭配DPDK 22版本,已通过RTE Flow配置端口多队列,基于IP+Port进行流量分流。现在需要复现网卡生成的RSS哈希值,实现跨网卡的流量负载均衡(依据数据包内部的GRE封装后内容而非外层IP/传输层信息),但目前自行计算的哈希值与mbuf中保存的不一致。

已配置的RTE Flow分流代码

/*rte flow*/
const int MAX_PATTERN_IN_FLOW = 10;
const int MAX_ACTIONS_IN_FLOW = 10;

struct rte_flow_attr attr;

struct rte_flow_item pattern[MAX_PATTERN_IN_FLOW];
struct rte_flow_action actions[MAX_ACTIONS_IN_FLOW];
struct rte_flow *flow;
struct rte_flow_error error;

memset(pattern, 0, sizeof(pattern));
memset(actions, 0, sizeof(actions));

/* Set the rule attribute, only ingress packets will be checked. */
memset(&attr, 0, sizeof(struct rte_flow_attr));
attr.ingress = 1;

pattern[0].type = RTE_FLOW_ITEM_TYPE_ETH;
pattern[0].spec = NULL;

pattern[1].type = RTE_FLOW_ITEM_TYPE_IPV4;
pattern[1].spec = NULL;

pattern[2].type = RTE_FLOW_ITEM_TYPE_GRE;
pattern[2].spec = NULL;

pattern[3].type = RTE_FLOW_ITEM_TYPE_ETH;
pattern[3].spec = NULL;

pattern[4].type = RTE_FLOW_ITEM_TYPE_IPV4;
pattern[4].spec = NULL;

pattern[5].type = RTE_FLOW_ITEM_TYPE_UDP;
pattern[5].spec = NULL;

// end the pattern array 
pattern[6].type = RTE_FLOW_ITEM_TYPE_END;

struct rte_flow_action_rss rss_conf;
uint16_t queues[pi_nNumRxQueues];
rss_conf.func = RTE_ETH_HASH_FUNCTION_DEFAULT;
uint64_t hf = RTE_ETH_RSS_IP | RTE_ETH_RSS_TCP | RTE_ETH_RSS_UDP | RTE_ETH_RSS_SCTP;
hf &= pi_devInfo.flow_type_rss_offloads;
rss_conf.types = hf;
rss_conf.queue_num = pi_nNumRxQueues;
for (int nqQueueIndex= 0; nqQueueIndex < pi_nNumRxQueues; nqQueueIndex++)
        queues[nqQueueIndex] = nqQueueIndex;

rss_conf.queue = queues;

rss_conf.key_len = 0;
rss_conf.key = NULL;
rss_conf.level = 2;

// create the drop action 
actions[0].type = RTE_FLOW_ACTION_TYPE_RSS;
actions[0].conf = &rss_conf;
actions[1].type = RTE_FLOW_ACTION_TYPE_END;

// validate and create the flow rule 
if (rte_flow_validate(pi_nPort, &attr, pattern, actions, &error)==0)
{
    flow = rte_flow_create(pi_nPort, &attr, pattern, actions, &error);
    if(flow){/*success*/}
    else{/*error*/}
}
else {/*error*/}

自行尝试的哈希计算代码

uint8_t rss_hash_default_key[] = {
    0x2c, 0xc6, 0x81, 0xd1,
    0x5b, 0xdb, 0xf4, 0xf7,
    0xfc, 0xa2, 0x83, 0x19,
    0xdb, 0x1a, 0x3e, 0x94,
    0x6b, 0x9e, 0x38, 0xd9,
    0x2c, 0x9c, 0x03, 0xd1,
    0xad, 0x99, 0x44, 0xa7,
    0xd9, 0x56, 0x3d, 0x59,
    0x06, 0x3c, 0x25, 0xf3,
    0xfc, 0x1f, 0xdc, 0x2a,
};

static inline uint32_t
do_softrss(struct rte_mbuf *m)
{
    uint32_t input_len;
    struct rte_ipv4_tuple ipv4_tuple;
    
    char * pRawPacket = static_cast<char*>(rte_pktmbuf_mtod(pi_mbuf, void* ));
    IpHeader * pIpHeader = (IpHeader *)(pRawPacket + offsetOfIp);
    if(pIpHeader->GetVersion()==4)
    {
        ipv4_tuple.src_addr = rte_be_to_cpu_32(pIpHeader->dwSrcAddressBigEndian);
        ipv4_tuple.dst_addr = rte_be_to_cpu_32(pIpHeader->dwDstAddressBigEndian);
        ipv4_tuple.sport = *(uint16_t*)(pRawPacket + transportLayerOffset);
        ipv4_tuple.dport = *(uint16_t*)(pRawPacket + transportLayerOffset+2);
        input_len = RTE_THASH_V4_L3_LEN;
        return rte_softrss_be((uint32_t *)&ipv4_tuple, input_len, rss_key_be);

    }
    return 0;
}
new_rss = do_softrss(mbuf_pointer);
std::cout<< std::hex << mbuf_pointer->hash.rss << " -> " << new_rss << std::dec << std::endl;

哈希值不一致的运行结果

5ed28a5c -> 33eb33eb
974c1896 -> 24e224e2
1edf1638 -> 21752175
8a54c19 -> 80638063
459a6f76 -> 1b351b35
1cdf1d1c -> e53be53b

网卡信息

ethtool -i ens5f0
driver: mlx5_core
version: 5.8-3.0.7
firmware-version: 22.32.2004 (MT_0000000437)
expansion-rom-version:
bus-info: 0000:83:00.0
supports-statistics: yes
supports-test: yes
supports-eeprom-access: no
supports-register-dump: no
supports-priv-flags: yes

问题分析与解决步骤

核心问题

  1. 哈希字段错误:RTE Flow配置的level=2是针对GRE封装后的内层IPv4+UDP做RSS,但自行计算时仅使用了外层IP和端口,完全未处理内层数据包内容。
  2. 哈希函数与密钥不匹配:ConnectX-6 Dx默认使用Toeplitz哈希,需确保软件计算的函数、密钥与硬件一致。
  3. 字节序处理错误:硬件RSS直接使用网络字节序计算,软件中不应转换为CPU字节序。

修正方案

1. 正确提取内层数据包字段

修改哈希计算代码,解析到GRE后的内层IPv4和UDP信息:

#include <rte_ip.h>
#include <rte_udp.h>

// 简化GRE头结构(仅处理必要字段)
struct gre_hdr {
    uint16_t flags;
    uint16_t protocol;
};

static inline uint32_t
do_softrss(struct rte_mbuf *m)
{
    char *pRawPacket = rte_pktmbuf_mtod(m, char*);
    uint32_t offset = 14; // 外层ETH头长度

    // 解析外层IPv4头
    struct rte_ipv4_hdr *outer_ip = (struct rte_ipv4_hdr*)(pRawPacket + offset);
    if (outer_ip->version != 4) return 0;
    offset += outer_ip->ihl * 4;

    // 解析GRE头,跳过可选字段
    struct gre_hdr *gre = (struct gre_hdr*)(pRawPacket + offset);
    offset += 4;
    if (gre->flags & 0x8000) offset += 2; // 跳过校验和字段
    if (gre->flags & 0x4000) offset += 4; // 跳过密钥字段
    if (gre->flags & 0x2000) offset += 4; // 跳过序列号字段

    offset += 14; // 内层ETH头长度
    // 解析内层IPv4头
    struct rte_ipv4_hdr *inner_ip = (struct rte_ipv4_hdr*)(pRawPacket + offset);
    if (inner_ip->version != 4) return 0;
    offset += inner_ip->ihl * 4;

    // 解析内层UDP头
    struct rte_udp_hdr *inner_udp = (struct rte_udp_hdr*)(pRawPacket + offset);

    // 构造哈希元组(保留网络字节序,不转换为CPU字节序)
    struct rte_ipv4_tuple ipv4_tuple;
    ipv4_tuple.src_addr = inner_ip->src_addr;
    ipv4_tuple.dst_addr = inner_ip->dst_addr;
    ipv4_tuple.sport = inner_udp->src_port;
    ipv4_tuple.dport = inner_udp->dst_port;

    // 使用L3+L4完整长度计算哈希
    uint32_t input_len = RTE_THASH_V4_L3_LEN + RTE_THASH_V4_L4_LEN;
    return rte_softrss_be((uint32_t *)&ipv4_tuple, input_len, rss_hash_default_key);
}

2. 对齐网卡哈希配置

修改RTE Flow中的RSS配置,显式指定Toeplitz哈希函数:

rss_conf.func = RTE_ETH_HASH_FUNCTION_TOEPLITZ; // 替换默认值

若网卡自定义过RSS密钥,通过以下命令获取硬件密钥并替换代码中的rss_hash_default_key:

ethtool -x ens5f1

3. 验证结果

修改后重新运行,计算出的new_rss应与mbuf->hash.rss完全一致。若仍有差异,需检查:

  • GRE可选字段的解析是否覆盖所有场景
  • 内层数据包的偏移计算是否准确
  • RSS类型配置(rss_conf.types)是否与软件计算的字段对应

内容的提问来源于stack exchange,提问作者yaron

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 00:09:59