You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Perceus构建的Scientific Linux6.9集群安装Condor后SSH超时修复咨询

解决SSH连接10分钟自动断开问题(Condor安装后)

这种情况我之前在类似的Scientific Linux 6.9集群环境里遇到过,大概率是Condor安装后改动了SSH的超时配置,或是Condor的网络相关规则干扰了SSH的长连接。结合你的环境(Perceus构建的集群、vnfs中安装Condor),给你几个针对性的排查和解决步骤:

1. 检查并调整SSH服务端超时配置

Condor安装过程中可能会修改sshd_config的默认参数,导致连接超时。

  • 编辑SSH服务端配置文件:
    vi /etc/ssh/sshd_config
    
  • 找到以下参数,调整为如下值(如果参数被注释,取消注释后修改):
    • ClientAliveInterval 60:服务端每60秒向客户端发送一次心跳包,确认连接存活
    • ClientAliveCountMax 3:连续3次未收到客户端回应才断开连接
    • TCPKeepAlive yes:开启TCP层面的心跳检测,避免中间网络设备主动断开连接
  • 重启SSH服务使配置生效:
    service sshd restart
    

注意:因为你是在vnfs镜像中做的修改,完成后需要用Perceus的vnfs update命令将更新后的镜像同步到所有集群节点,再重启节点确保配置生效。

2. 排查Condor的网络配置干扰

Condor自身的网络优化或防火墙规则可能会限制SSH的长连接:

  • 查看Condor主配置文件/etc/condor/condor_config,检查是否有FIREWALL_RULES、NETWORK_INTERFACE等配置,确认没有对SSH端口(22)设置连接超时或拦截规则
  • 检查系统iptables规则,确认没有针对SSH连接的超时限制:
    iptables -L -n -v
    
    如果发现带有--timeout参数的SSH相关规则,可调整超时时间或直接移除该规则
  • 查看Condor日志目录/var/log/condor/下的日志文件,排查是否有Condor组件主动终止SSH连接的记录

3. 客户端临时验证(快速定位问题)

如果暂时没法修改服务端配置,可以先在SSH客户端开启心跳,验证是否是服务端超时导致的问题:

  • 编辑客户端的SSH配置文件~/.ssh/config(如果没有则创建),添加以下内容:
    Host *
      ServerAliveInterval 60
      ServerAliveCountMax 3
    
    这样客户端会每60秒向服务端发送心跳包,避免被断开。如果此方法有效,就可以确定是服务端的超时配置问题,再回到步骤1做永久修改。

4. 调整系统TCP内核参数

Scientific Linux 6.9的内核TCP参数可能被Condor修改,导致长连接提前断开:

  • 查看当前TCP keepalive参数:
    sysctl net.ipv4.tcp_keepalive_time net.ipv4.tcp_keepalive_intvl net.ipv4.tcp_keepalive_probes
    
  • 如果参数值过小(比如tcp_keepalive_time小于3600秒),调整为更合理的值:
    sysctl -w net.ipv4.tcp_keepalive_time=300
    sysctl -w net.ipv4.tcp_keepalive_intvl=60
    sysctl -w net.ipv4.tcp_keepalive_probes=3
    
  • 将这些参数写入/etc/sysctl.conf,确保系统重启后参数依然生效:
    echo "net.ipv4.tcp_keepalive_time=300" >> /etc/sysctl.conf
    echo "net.ipv4.tcp_keepalive_intvl=60" >> /etc/sysctl.conf
    echo "net.ipv4.tcp_keepalive_probes=3" >> /etc/sysctl.conf
    

5. 确认Perceus vnfs镜像同步

所有配置修改完成后,务必确保vnfs镜像的更新同步到集群节点:

  • 执行Perceus命令更新节点镜像:
    perceus vnfs update <vnfs-name>
    
  • 重启集群节点使新配置生效:
    perceus node reboot <node-name>
    

内容的提问来源于stack exchange,提问作者김연경

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 04:23:28