You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GKE Autopilot节点Nvidia驱动版本查询及指定版本方法问询

GKE Autopilot Nvidia驱动相关问题解答

1. 默认Nvidia驱动版本

GKE Autopilot的默认Nvidia驱动版本无固定值,会随集群使用的Kubernetes版本、GCP服务更新动态变化。早期部署的Autopilot集群默认多为470.x系列,较新版本的集群(如K8s 1.26及以上)默认会采用525.x等更新的驱动系列。

2. 查询当前节点的驱动版本

有两种常用方法:

  • 通过节点标签查询:Autopilot会为GPU节点添加驱动版本标签,执行以下命令(替换对应的加速器类型,如nvidia-tesla-a100)即可查看:
    kubectl get nodes -l cloud.google.com/gke-accelerator=nvidia-tesla-t4 -o jsonpath='{.items[*].metadata.labels.cloud\.google\.com/gke-nvidia-driver-version}'
    
  • 通过节点调试查看:先进入目标节点的调试容器,再执行驱动查询命令:
    # 替换<node-name>为实际节点名称
    kubectl debug node/<node-name> -it --image=ubuntu
    # 在调试容器内执行
    nvidia-smi
    
    输出结果中Driver Version字段即为当前驱动版本。

3. 配置节点使用525版本驱动

GKE Autopilot支持通过节点池配置指定Nvidia驱动版本,操作方式如下:

  • 创建新的Autopilot节点池时指定驱动版本:
    gcloud container node-pools create <pool-name> \
      --cluster=<cluster-name> \
      --region=<region> \
      --accelerator type=nvidia-tesla-t4,count=1 \
      --nvidia-driver-version=525.105.17
    
  • 更新现有节点池的驱动版本:
    gcloud container node-pools update <pool-name> \
      --cluster=<cluster-name> \
      --region=<region> \
      --nvidia-driver-version=525.105.17
    
    注意:更新节点池会触发节点滚动重建,需提前做好业务容灾准备。

4. 能否通过nodeSelector创建指定驱动版本的节点?

不能。nodeSelector仅用于将Pod调度到已有符合标签条件的节点上,无法触发Autopilot创建新的指定驱动版本的节点。若要创建使用525版本驱动的节点,必须通过上述节点池配置指定驱动版本;节点创建完成后,可在Pod配置中添加nodeSelector将Pod调度到这些节点:

spec:
  nodeSelector:
    cloud.google.com/gke-nvidia-driver-version: "525.105.17"

内容的提问来源于stack exchange,提问作者GRS

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 04:05:16