如何在Google Cloud Vertex AI Workbench JupyterLab中启动Spark Session?
解决Vertex AI Workbench JupyterLab中启动Spark Session的问题
问题根源
报错核心原因很明确:
- Vertex AI Workbench运行在Linux系统环境下,但你代码里硬编码了Windows系统的
JAVA_HOME路径C:/Program Files/Java/jdk-18.0.1.1,Linux无法识别Windows盘符格式的路径,导致找不到Java可执行文件,最终Spark启动失败。 - 实际上Vertex AI Workbench默认已经预装了Java,完全不需要手动设置Windows风格的
JAVA_HOME。
修正后的可用代码
移除错误的Windows路径配置,直接使用环境自带的Java,正确初始化Spark Session:
# 安装Spark NLP和PySpark依赖 !pip install -q spark-nlp==4.0.1 pyspark==3.3.0 # 无需手动设置Windows风格JAVA_HOME,Vertex AI已预装Java import sparknlp # 初始化Spark Session(Spark NLP的start方法会自动配置必要参数) spark = sparknlp.start() # 验证版本信息 print(f"Spark NLP version: {sparknlp.version()}") print(f"Apache Spark version: {spark.version}") # 查看Spark Session详情 spark
额外配置说明
如果需要自定义Spark参数(比如调整内存分配),可以通过sparknlp.start()的参数实现:
# 给Spark分配8GB内存 spark = sparknlp.start(memory="8G")
如果遇到Java版本兼容问题,可先检查环境中的Java信息:
!which java !java -version
根据输出的Java路径,设置符合Linux规范的JAVA_HOME(示例路径,以实际输出为准):
import os os.environ["JAVA_HOME"] = "/usr/lib/jvm/java-11-openjdk-amd64" os.environ["PATH"] = os.environ["JAVA_HOME"] + "/bin:" + os.environ["PATH"]
内容的提问来源于stack exchange,提问作者gracenz
相关产品推荐
相关产品推荐

