Databricks生产集群REPL启动失败,重启克隆后仍未解决求助
问题描述
今天上午在生产环境启动手动集群运行代码时,代码无法执行,报错:
Failure starting repl. Try detaching and re-attaching the notebook.
集群当前无任何作业运行,但完全无法执行任何任务。已尝试重启集群、克隆集群,问题仍未解决。完整报错堆栈如下:
Failure starting repl. Try detaching and re-attaching the notebook. java.lang.Exception: Futures timed out after [80 seconds] at scala.concurrent.impl.Promise$DefaultPromise.ready(Promise.scala:259) at scala.concurrent.impl.Promise$DefaultPromise.result(Promise.scala:263) at scala.concurrent.Await$.$anonfun$result$1(package.scala:223) at scala.concurrent.BlockContext$DefaultBlockContext$.blockOn(BlockContext.scala:57) at scala.concurrent.Await$.result(package.scala:146) at com.databricks.backend.daemon.driver.JupyterDriverLocal$RequestStatus.waitForReply(JupyterDriverLocal.scala:210) at com.databricks.backend.daemon.driver.JupyterDriverLocal.requestKernelInfo(JupyterDriverLocal.scala:695) at com.databricks.backend.daemon.driver.JupyterDriverLocal.$anonfun$startPython$1(JupyterDriverLocal.scala:1164) at scala.runtime.java8.JFunction0$mcV$sp.apply(JFunction0$mcV$sp.java:23) at scala.util.Try$.apply(Try.scala:213) at com.databricks.backend.daemon.driver.JupyterDriverLocal.com$databricks$backend$daemon$driver$JupyterDriverLocal$$withRetry(JupyterDriverLocal.scala:1127) at com.databricks.backend.daemon.driver.JupyterDriverLocal$$anonfun$com$databricks$backend$daemon$driver$JupyterDriverLocal$$withRetry$1.applyOrElse(JupyterDriverLocal.scala:1130) at com.databricks.backend.daemon.driver.JupyterDriverLocal$$anonfun$com$databricks$backend$daemon$driver$JupyterDriverLocal$$withRetry$1.applyOrElse(JupyterDriverLocal.scala:1127) at scala.runtime.AbstractPartialFunction.apply(AbstractPartialFunction.scala:38) at scala.util.Failure.recover(Try.scala:234) at com.databricks.backend.daemon.driver.JupyterDriverLocal.com$databricks$backend$daemon$driver$JupyterDriverLocal$$withRetry(JupyterDriverLocal.scala:1127) at com.databricks.backend.daemon.driver.JupyterDriverLocal.startPython(JupyterDriverLocal.scala:1144) at com.databricks.backend.daemon.driver.JupyterDriverLocal.<init>(JupyterDriverLocal.scala:640) at com.databricks.backend.daemon.driver.PythonDriverWrapper.instantiateDriver(DriverWrapper.scala:792) at com.databricks.backend.daemon.driver.DriverWrapper.setupRepl(DriverWrapper.scala:355) at com.databricks.backend.daemon.driver.DriverWrapper.run(DriverWrapper.scala:241) at java.lang.Thread.run(Thread.java:750)
排查建议
- 检查集群节点资源:确认集群的CPU、内存、磁盘空间是否充足,节点是否处于健康状态,资源不足常导致REPL启动超时。
- 验证集群配置:核对Spark版本、Python版本与代码的兼容性,排查自定义环境依赖包是否存在冲突。
- 查看集群日志:进入集群Driver日志页面,查找依赖加载失败、权限异常或网络连接问题等深层错误信息。
- 创建全新集群:使用不同节点规格、运行时版本搭建新集群,排除原有集群配置的隐性问题。
- 检查权限设置:确认当前用户拥有操作集群、访问资源及执行作业的完整权限。
- 重启笔记本会话:完全关闭并重新打开笔记本后,再尝试连接集群。
内容的提问来源于stack exchange,提问作者B C
相关产品推荐
相关产品推荐

