Kops部署的Kubernetes集群单Master节点异常:Not Ready状态与kube-apiserver频繁重启问题求助
Kops部署的Kubernetes集群单Master节点异常:Not Ready状态与kube-apiserver频繁重启问题求助
各位大佬好,我这边碰到个头疼的问题,想请大家帮忙诊断下:
- 我们用KOPS在AWS上部署的Kubernetes v1.20集群状态异常:3个master节点里有1个会间歇性进入Not Ready状态,而且这个节点上的kube-apiserver pod重启得特别频繁——1小时内居然重启了50次,另外两个master节点运行完全正常。
- 有时候执行
kubectl get cs,会看到其中一个etcd组件进入Unhealthy状态,还伴随HTTP 503错误;执行kubectl get --raw='/readyz?verbose'或者kubectl get --raw='/livez?verbose'也会得到一模一样的异常结果。不过这些状态不是持续异常,偶尔又会自行恢复正常。 - 查看那个异常master节点上的kube-apiserver pod的历史日志,发现了明确的报错:
etcd failed: error getting data from etcd: context deadline exceeded
目前业务还能正常运转,但我心里一直悬着——要是后续业务负载上去了,剩下的2个master节点可能扛不住,甚至会出现第二个节点故障的情况,所以想尽快把这个问题解决掉,麻烦各位大佬给点思路!
备注:内容来源于stack exchange,提问作者Felix Labayen
相关产品推荐
相关产品推荐

