You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何让AKS中的gpu-resources仅运行在GPU节点池上?

解决方法

要让nvidia-device-plugin-daemonset仅运行在GPU节点池,需要给DaemonSet添加节点选择约束,仅允许调度到GPU节点。容忍度只是允许Pod调度到带有对应污点的节点,但不会阻止它调度到无污点的CPU节点,这是导致Pod跑到网络节点池的核心原因。

步骤1:确认GPU节点的标签

先查看GPU节点的标签,执行命令:

kubectl get nodes --show-labels

找到GPU节点共有的标签,比如AKS默认会给节点池添加kubernetes.azure.com/agentpool=<GPU节点池名称>标签,或者你可以看到对应污点的sku=gpu标签(和GPU节点池的污点sku=gpu:NoSchedule对应)。

步骤2:修改DaemonSet配置,添加节点选择规则

编辑DaemonSet配置:

kubectl edit daemonset nvidia-device-plugin-daemonset -n gpu-resources

在spec.template.spec下添加以下其中一种约束:

方式1:使用nodeSelector(简单直接)

如果GPU节点有sku=gpu标签,添加:

nodeSelector:
  sku: gpu

方式2:使用nodeAffinity(更灵活,支持多条件匹配)

如果需要更精确的匹配,比如匹配节点池名称:

affinity:
  nodeAffinity:
    requiredDuringSchedulingIgnoredDuringExecution:
      nodeSelectorTerms:
      - matchExpressions:
        - key: kubernetes.azure.com/agentpool
          operator: In
          values:
          - <你的GPU节点池名称>

添加后保存配置,调度器会自动将DaemonSet的Pod只调度到符合条件的GPU节点,网络节点池的CPU节点上的失败Pod会被自动清理。


内容的提问来源于stack exchange,提问作者arun

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 14:11:12