You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

执行merged_data.toPandas()时触发Apache Spark连接拒绝错误求助

解决Spark调用toPandas()时出现ConnectionRefusedError的方案

以下是针对你遇到问题的具体解决步骤:

  • 显式配置Spark Driver网络地址
    在创建SparkSession时强制指定Driver绑定本地回环地址,避免Windows下Spark自动选择不可达的网络接口:

    from pyspark.sql import SparkSession
    
    spark = SparkSession.builder \
        .appName("YourApplication") \
        .config("spark.driver.host", "127.0.0.1") \
        .config("spark.driver.bindAddress", "127.0.0.1") \
        .getOrCreate()
    

    这个设置会让Driver只监听本地地址,确保Executor能正常连接。

  • 修改Spark全局配置文件
    如果希望所有Spark应用默认生效,找到SPARK_HOME/conf目录,复制spark-defaults.conf.template并重命名为spark-defaults.conf,添加以下配置:

    spark.driver.host 127.0.0.1
    spark.driver.bindAddress 127.0.0.1
    

    保存后重启任何正在运行的Spark进程即可生效。

  • 检查Windows防火墙权限
    确认Windows防火墙允许Java进程(java.exe)的入站和出站连接,或者临时关闭防火墙测试是否为防火墙拦截导致的连接拒绝(测试完成后记得重新开启防火墙)。

  • 验证Java版本兼容性
    Spark 3.4.0官方推荐使用Java 8或Java 11 LTS版本,你当前使用的Java 20是非长期支持版本,可能存在潜在的通信兼容性问题,建议降级到Java 11 LTS版本以避免异常。

  • 确认Hadoop winutils配置
    确保HADOOP_HOME/bin下的winutils.exe为Hadoop 3.3对应版本,且HADOOP_HOME已添加到系统PATH;同时检查C盘下tmp/hive目录存在,并用以下命令设置权限:

    winutils.exe chmod 777 C:\tmp\hive
    

内容的提问来源于stack exchange,提问作者007mrviper

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 16:12:40