You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Apache PySpark无法连接远程Spark Master 7077端口求助

解决Windows本地PySpark连接远程Spark集群的问题

为什么本地需要配置HADOOP_HOME?

Spark客户端(本地PySpark)运行时会依赖Hadoop的部分工具类和原生库,哪怕只是连接远程集群,本地Spark进程启动时仍会加载这些组件,所以必须在Windows本地配置HADOOP_HOME并提供对应工具。

具体解决步骤

1. 配置本地HADOOP环境

  • 下载与服务器端Hadoop版本匹配的Windows二进制包,解压到本地目录(比如D:\hadoop-3.3.4)
  • 配置系统环境变量:
    • 添加HADOOP_HOME变量,值为解压路径(如D:\hadoop-3.3.4)
    • 在Path变量中新增%HADOOP_HOME%\bin
  • 下载对应版本的winutils.exe,放入%HADOOP_HOME%\bin目录
  • 重启命令行或IDE,使环境变量生效

2. 修复远程Spark Master连接问题

  • 直接用服务器IP替代主机名ubuntu-spark,避免DNS解析潜在问题,比如将master地址改为spark://192.168.x.x:7077(替换为你的服务器实际IP)
  • 检查服务器端Spark Master的spark-env.sh配置,确保SPARK_MASTER_HOST设置为服务器的内网/公网IP,而非localhost或127.0.0.1,否则本地无法访问
  • 验证7077端口连通性:在Windows命令行执行telnet 192.168.x.x 7077,能连通说明端口正常开放
  • 确保本地PySpark版本与远程Spark集群版本完全一致,版本不兼容会导致连接失败

测试代码

from pyspark.sql import SparkSession

# 替换为你的Spark Master实际IP
spark = SparkSession.builder.master("spark://192.168.1.100:7077").appName("test").getOrCreate()
print("Spark集群连接成功")
spark.stop()

内容的提问来源于stack exchange,提问作者A456B123

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.13 10:50:37