You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GCP AI Platform Pipelines创建后无法打开仪表盘问题咨询

解决GCP AI Platform Pipelines重建后Dashboard无法打开的问题

根据你遇到的情况——首次创建Kubeflow Pipeline成功,删除后重建出现Dashboard打不开、Kubernetes Applications显示失败但组件状态正常的问题,大概率是残留的旧资源或元数据冲突导致的,下面是几个可尝试的排查和修复步骤:

1. 清理残留的集群资源

删除操作有时会留下未清理干净的关联资源,尤其是自定义资源(CRD)或命名空间配置:

  • 先查看当前集群的Kubeflow相关命名空间,确认是否有残留:
    kubectl get namespaces | grep -E "kubeflow|ai-platform-pipelines"
    
  • 如果发现旧命名空间,先清空里面的所有资源再删除命名空间:
    kubectl delete all --all -n <旧命名空间名称>
    kubectl delete namespace <旧命名空间名称>
    
  • 检查并删除残留的Kubeflow相关CRD:
    kubectl get crds | grep kubeflow
    kubectl delete crd <CRD名称>
    

2. 同步Kubernetes Applications状态

GCP控制台的状态显示可能存在延迟或不同步,试试这步:

  • 进入Kubernetes Engine的Applications页面,找到显示“Application Failed”的Kubeflow应用,点击同步状态按钮,等待几分钟后刷新页面,观察状态是否更新。
  • 如果同步后依旧显示失败,尝试删除该应用(注意不是删除集群),再严格按照教程步骤重新创建AI Platform Pipelines。

3. 验证Dashboard的Ingress和服务状态

Dashboard无法打开可能和Ingress或前端服务有关,即使组件状态显示正常,也可以手动验证:

  • 查看Kubeflow命名空间下的Ingress资源:
    kubectl get ingress -n kubeflow
    
    确认ADDRESS字段有正常IP,且READY状态为True。
  • 查看Dashboard前端服务的运行状态:
    kubectl get svc -n kubeflow | grep dashboard
    
    确认服务没有Pending或Error状态,CLUSTER-IP正常分配。

4. 排查应用事件和Pod日志

组件状态正常不代表没有隐藏错误,通过事件和日志定位问题:

  • 查看Kubeflow命名空间下的事件记录,按时间排序查找错误或警告:
    kubectl get events -n kubeflow --sort-by='.metadata.creationTimestamp'
    
  • 查看Dashboard相关Pod的日志,排查具体错误:
    kubectl logs <Dashboard Pod名称> -n kubeflow
    
    替换<Dashboard Pod名称>为实际的Pod名称,重点关注连接失败、权限异常等提示。

5. 确保工具和教程版本最新

旧版本工具或教程可能存在兼容性问题:

  • 更新你的gcloud命令行工具到最新版本:
    gcloud components update
    
  • 重新查阅AI Platform Pipelines的官方教程,确认是否有更新的创建参数、权限配置等步骤。

内容的提问来源于stack exchange,提问作者Ilkin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.07 17:42:48