全新稳定版GKE Autopilot集群上Google Managed Prometheus示例运行失败
问题概述
Google Managed Prometheus(GMP)作为托管式Prometheus服务,遵循官方指引配置后仍无法正常运行,以下是完整复现流程及报错详情:
复现步骤
- 创建版本为
1.21.12-gke.2200的全新GKE Autopilot集群 - 执行gcloud命令启用Managed Prometheus:
gcloud beta container clusters update <mycluster> --enable-managed-prometheus --region us-central1 - 添加放行8443端口的防火墙规则
- 安装ingress-nginx组件
具体报错
- PodMonitoring创建失败(证书不匹配)
尝试部署ingress-nginx的PodMonitoring清单时,返回内部错误:
Error from server (InternalError): error when creating "ingress-nginx/metrics.yaml": Internal error occurred: failed calling webhook "default.podmonitorings.gmp-operator.gke-gmp-system.monitoring.googleapis.com": Post "https://gmp-operator.gke-gmp-system.svc:443/default/monitoring.googleapis.com/v1/podmonitorings?timeout=10s": x509: certificate is valid for gmp-operator, gmp-operator.gmp-system, gmp-operator.gmp-system.svc, not gmp-operator.gke-gmp-system.svc
- 端口转发失败
执行端口转发命令kubectl -n gke-gmp-system port-forward svc/gmp-operator 8443时,报错:
error: Pod 'gmp-operator-67d5fff8b9-p4n7t' does not have a named port 'webhook'
修复进度说明
该问题已被官方关注,相关线程提及计划于2022年8月11日当周完成修复,但截至当前该功能仍无法正常运行。
内容的提问来源于stack exchange,提问作者mdkeyhoe

