You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Google Cloud Vertex AI Workbench JupyterLab中启动Spark Session?

解决Vertex AI Workbench JupyterLab中启动Spark Session的问题

问题根源

报错核心原因很明确:

  • Vertex AI Workbench运行在Linux系统环境下,但你代码里硬编码了Windows系统的JAVA_HOME路径C:/Program Files/Java/jdk-18.0.1.1,Linux无法识别Windows盘符格式的路径,导致找不到Java可执行文件,最终Spark启动失败。
  • 实际上Vertex AI Workbench默认已经预装了Java,完全不需要手动设置Windows风格的JAVA_HOME。

修正后的可用代码

移除错误的Windows路径配置,直接使用环境自带的Java,正确初始化Spark Session:

# 安装Spark NLP和PySpark依赖
!pip install -q spark-nlp==4.0.1 pyspark==3.3.0

# 无需手动设置Windows风格JAVA_HOME,Vertex AI已预装Java
import sparknlp

# 初始化Spark Session(Spark NLP的start方法会自动配置必要参数)
spark = sparknlp.start()

# 验证版本信息
print(f"Spark NLP version: {sparknlp.version()}")
print(f"Apache Spark version: {spark.version}")

# 查看Spark Session详情
spark

额外配置说明

如果需要自定义Spark参数(比如调整内存分配),可以通过sparknlp.start()的参数实现:

# 给Spark分配8GB内存
spark = sparknlp.start(memory="8G")

如果遇到Java版本兼容问题,可先检查环境中的Java信息:

!which java
!java -version

根据输出的Java路径,设置符合Linux规范的JAVA_HOME(示例路径,以实际输出为准):

import os
os.environ["JAVA_HOME"] = "/usr/lib/jvm/java-11-openjdk-amd64"
os.environ["PATH"] = os.environ["JAVA_HOME"] + "/bin:" + os.environ["PATH"]

内容的提问来源于stack exchange,提问作者gracenz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.25 08:15:43