Flink 1.9.0 TaskManager Kubernetes存活探针失效问题求助
关于Flink 1.9.0 TaskManager 6122端口的问题解答
是的,Flink 1.9.0版本的TaskManager默认确实会监听6122端口 —— 这个端口是TaskManager与JobManager进行RPC通信的默认端口,属于Flink集群内部通信的核心端口之一。
你遇到的dial tcp 10.20.1.54:6122: connect: connection refused错误,本质上不是端口本身不存在,而是TaskManager进程要么还没完成启动、要么启动失败,导致6122端口未正常监听。针对这个问题,你可以按以下步骤排查:
- 验证Pod内端口监听状态:进入TaskManager Pod执行命令
netstat -tulpn | grep 6122或ss -tulpn | grep 6122,确认是否有Flink进程在监听该端口。如果没有,说明TaskManager启动异常。 - 查看TaskManager完整启动日志:通过
kubectl logs <你的taskmanager-pod名称> -c taskmanager获取容器内的详细日志,重点查找启动阶段的报错(比如资源不足、无法连接JobManager、配置文件错误等),这些通常是导致端口未监听的根本原因。 - 调整存活探针的启动延迟:如果TaskManager启动较慢,而你的存活探针
initialDelaySeconds设置得过短,就会在进程未就绪时触发探测失败。建议将该参数调整为30秒以上,给TaskManager足够的启动时间。 - 检查Flink配置是否修改了RPC端口:确认你的
flink-conf.yaml中是否设置了taskmanager.rpc.port参数,如果该参数被修改为其他值,那么探针使用默认的6122端口自然会连接失败。
内容的提问来源于stack exchange,提问作者Dagang Wei
相关产品推荐
相关产品推荐

