在Ubuntu 18.04.5中运行首个PySpark代码的方法咨询
运行多节点PySpark脚本的实操指南
执行位置
你可以在集群的任意节点执行脚本,但优先推荐在**Spark主节点(Master Node)**上操作,能直接将任务提交到集群调度系统;如果你的机器装有Spark客户端,也可以在本地以客户端模式运行。
两种核心运行方式
1. 用spark-submit提交(集群模式首选)
这是Spark官方标准的集群任务提交方式,命令格式如下:
spark-submit --master spark://<主节点IP>:<端口> firstcode.py
- 替换
<主节点IP>:<端口>为你集群Master的实际地址(默认端口为7077) - 若需指定资源配额,可追加参数调整:
spark-submit --master spark://<主节点IP>:7077 --executor-memory 2G --total-executor-cores 4 firstcode.py
2. 直接用Python运行(本地测试/客户端模式)
如果仅需验证脚本逻辑,确保本地已配置PYSPARK_PYTHON环境变量后,直接执行:
python firstcode.py
若要指定连接远程集群,可在代码里显式配置Master地址:
from pyspark.sql import SparkSession spark = SparkSession.builder \ .master("spark://<主节点IP>:7077") \ .appName("FirstPySparkDemo") \ .getOrCreate() # 你的DataFrame创建及打印代码...
之后再用python firstcode.py启动即可。
关键注意事项
- 确保脚本路径可被执行节点访问:主节点执行时直接放在本地路径;其他节点执行需将脚本放在共享存储(如HDFS、NFS),或用
--py-files参数上传脚本到集群。 - 检查Spark环境变量:确认
SPARK_HOME已正确设置,且PATH包含$SPARK_HOME/bin。
内容的提问来源于stack exchange,提问作者seriouslyimanoob
相关产品推荐
相关产品推荐

