AWS EKS中Karpenter调度节点(含Spot实例)偶发性能下降、连接异常及指标离线问题排查求助
AWS EKS中Karpenter调度节点(含Spot实例)偶发性能下降、连接异常及指标离线问题排查求助
大家好,我最近在AWS EKS集群里碰到了一个偶发的棘手问题,想请教下社区里有没有朋友遇到过类似情况,或者能给些排查思路,非常感谢!
我的集群环境
- 1个AWS EKS集群
- 包含1个按需节点组
- 1个Karpenter v0.29.2的provisioner,负责调度Spot实例,实例规格为2vCPU、8-16G内存,可选实例类型列表:
["m5a.large", "m5.large", "m6i.large", "r5a.large", "m5d.large", "r5.large", "r6i.large", "r5n.large", "c5.xlarge", "c6i.xlarge"] - 每个节点上运行6-8个API业务Pod
出现的问题现象
- 偶发API响应延迟暴增到20秒以上(正常情况下响应耗时仅10-20ms)
- 同时Prometheus的
up指标会变为0,持续1-3分钟;当up指标恢复为1后,API性能也随之回到正常水平 - 伴随出现Redis或Mongo的连接超时/连接拒绝问题
已做的排查动作
- 对比了异常节点和正常节点的系统日志,未发现明显差异
- 尝试将Karpenter provisioner改为调度按需实例,问题仍然存在;且当增加单节点上的API Pod数量时,问题出现频率明显提升,目前暂时通过减少单节点Pod数量来缓解
- 监控数据显示:节点CPU、内存使用率在50-70%区间;磁盘使用gp3规格(3000 IOPS配额),实际磁盘IOPS不到600,应该没有达到阈值或被限流
想请教下,有没有朋友碰到过Karpenter调度的节点出现这类偶发性能下降的情况?或者有什么后续的排查方向可以推荐吗?
备注:内容来源于stack exchange,提问作者Tristan
相关产品推荐
相关产品推荐

