You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Ubuntu 18.04.5中运行首个PySpark代码的方法咨询

运行多节点PySpark脚本的实操指南

执行位置

你可以在集群的任意节点执行脚本,但优先推荐在**Spark主节点(Master Node)**上操作,能直接将任务提交到集群调度系统;如果你的机器装有Spark客户端,也可以在本地以客户端模式运行。

两种核心运行方式

1. 用spark-submit提交(集群模式首选)

这是Spark官方标准的集群任务提交方式,命令格式如下:

spark-submit --master spark://<主节点IP>:<端口> firstcode.py
  • 替换<主节点IP>:<端口>为你集群Master的实际地址(默认端口为7077)
  • 若需指定资源配额,可追加参数调整:
spark-submit --master spark://<主节点IP>:7077 --executor-memory 2G --total-executor-cores 4 firstcode.py

2. 直接用Python运行(本地测试/客户端模式)

如果仅需验证脚本逻辑,确保本地已配置PYSPARK_PYTHON环境变量后,直接执行:

python firstcode.py

若要指定连接远程集群,可在代码里显式配置Master地址:

from pyspark.sql import SparkSession

spark = SparkSession.builder \
    .master("spark://<主节点IP>:7077") \
    .appName("FirstPySparkDemo") \
    .getOrCreate()

# 你的DataFrame创建及打印代码...

之后再用python firstcode.py启动即可。

关键注意事项

  • 确保脚本路径可被执行节点访问:主节点执行时直接放在本地路径;其他节点执行需将脚本放在共享存储(如HDFS、NFS),或用--py-files参数上传脚本到集群。
  • 检查Spark环境变量:确认SPARK_HOME已正确设置,且PATH包含$SPARK_HOME/bin。

内容的提问来源于stack exchange,提问作者seriouslyimanoob

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.08 06:31:21