dask-kubernetes KubeCluster运行卡住报TypeError问题求助
问题原因
报错根因是你提供的Pod模板(pod-spec.yaml)中容器配置未定义args字段,dask-kubernetes在创建worker节点时会尝试向容器启动参数追加worker名称配置项,此时未初始化的args字段为None类型,无法直接和列表执行+=操作,触发类型错误。
此外你当前的Pod模板设置了固定的metadata.name值,KubeCluster扩容多个worker时会生成相同名称的Pod,导致后续Pod创建失败,也是程序卡住无进展的原因之一。
修复方案
修改pod-spec.yaml配置,给容器添加空的args字段,同时删除固定的Pod名称配置即可:
apiVersion: v1 kind: Pod metadata: labels: app: cliff-docker-test spec: imagePullSecrets: - name: <redacted> securityContext: runAsUser: 1000 restartPolicy: OnFailure containers: - name: cliff-test-container image: <redacted: works with docker pull> imagePullPolicy: Always args: [] # 新增空args字段,供dask自动填充worker启动参数 resources: limits: cpu: 2 memory: 4G requests: cpu: 1 memory: 2G
修改完成后重新运行main.py,即可正常启动worker集群,执行计算后会输出预期结果1.0。
内容的提问来源于stack exchange,提问作者Cliff
相关产品推荐
相关产品推荐

