You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS ParallelCluster 2.11 创建失败 计算节点无法正常启动问题求助

你遇到的MasterServer资源信号超时是表面错误,根因是配置的初始静态计算节点无法完成初始化,被集群管理服务判定为不健康,导致整个集群创建流程超时。下面是优先级从高到低的排查步骤:

排查步骤
  • VPC网络连通性校验
    你的配置中use_public_ips = false,表示计算节点不会分配公网IP,此时必须满足两个条件之一:1、计算节点所在的子网配置了NAT网关,可正常访问公网获取初始化依赖、调用AWS服务接口;2、VPC配置了所有必需的服务端点,包含S3、EC2、CloudFormation、CloudWatch、Systems Manager等ParallelCluster依赖的服务端点。如果不满足,计算节点无法完成初始化流程,会被判定为不健康。
  • EFA配置合法性校验
    你开启了enable_efa = true,需检查以下几项:
    • 计算节点所在子网所属的可用区支持c5n.18xlarge实例的EFA功能
    • 集群关联的安全组已放行同一安全组内的所有UDP入站流量,满足EFA通信要求
    • 若使用自定义CentOS7镜像,需确认已预先安装EFA驱动,默认ParallelCluster官方镜像会自动安装
  • 计算节点日志排查
    在集群创建超时前登录主节点后,可直接尝试SSH登录故障计算节点,查看以下日志定位初始化失败原因:
    • /var/log/cloud-init.log、/var/log/cloud-init-output.log:查看系统初始化阶段的报错
    • /var/log/parallelcluster/computemgtd:查看ParallelCluster计算节点管理服务的报错
    • /var/log/slurm/slurmd.log:查看Slurm计算节点服务的启动日志
      同时可测试计算节点是否可正常ping通主节点、是否可正常挂载共享EBS卷。
  • 资源配额校验
    检查你AWS账号us-east-1区域的EC2 vCPU配额,c5n.18xlarge单实例需36个vCPU(你开启了disable_hyperthreading = true),需确认On-Demand实例的vCPU配额足够启动你配置的初始节点数。
  • 置放群组配置校验
    你配置了placement_group = DYNAMIC,EFA要求同队列的计算节点必须在同一个置放群组内,若可用区资源不足无法创建置放群组,也会导致计算节点初始化失败,可尝试将placement_group设为NONE后重试创建,确认是否为置放群组问题。

内容的提问来源于stack exchange,提问作者notKnotTheory

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 10:36:02