PySpark使用UDF时提示无法找到Python报错问题求助
Windows本地PySpark执行UDF报Python未找到问题排查方案
问题表现
仅在PySpark UDF触发实际计算(如调用df.show())时抛出异常,非UDF场景(如Spark DataFrame转Pandas DataFrame执行相同逻辑函数)运行无异常。
触发报错的示例代码
import pyspark.sql.functions as sql_func test_udf = sql_func.udf(lambda x: x.lower(), StringType()) df.withColumn("Sample", test_udf("SampleCol")).show(5)
核心报错信息
Python was not found; run without arguments to install from the Microsoft Store, or disable this shortcut from Settings > Manage App Execution Aliases. 22/06/30 10:49:45 WARN ProcfsMetricsGetter: Exception when trying to compute pagesize, as a result reporting of ProcessTree metrics is stopped 22/06/30 10:49:46 ERROR Executor: Exception in task 0.0 in stage 4.0 (TID 7) org.apache.spark.SparkException: Python worker failed to connect back.
基础环境信息
- 操作系统:Windows 10
- 运行环境:Python 3.9.6版本虚拟环境
- 组件版本:Spark 3.3
已验证无效方案
- 在「设置>管理应用执行别名」中关闭Python相关快捷方式
- 在系统环境变量中添加
PYSPARK_PYTHON配置项
可落地解决步骤
- 优先在代码内显式指定Python解释器路径,避免子进程读不到虚拟环境配置
在初始化SparkSession的代码之前,追加以下配置,强制driver和worker进程使用当前脚本运行的Python解释器:
注意:上述代码必须放在import os import sys os.environ['PYSPARK_PYTHON'] = sys.executable os.environ['PYSPARK_DRIVER_PYTHON'] = sys.executableSparkSession.builder...getOrCreate()逻辑之前执行,配置才会生效。 - 修正环境变量配置方式
如果坚持用系统环境变量配置PYSPARK_PYTHON,值必须填写虚拟环境下Python解释器的完整绝对路径,格式参考C:\project\your_venv\Scripts\python.exe,不能填python这类短别名。配置完成后必须完全关闭当前终端、IDE进程,重新启动后再运行代码,旧进程不会加载更新后的环境变量。 - 补充Spark环境配置
进入Spark安装目录下的conf文件夹,新建或编辑spark-env.cmd文件,追加以下配置:set PYSPARK_PYTHON=C:\project\your_venv\Scripts\python.exe set PYSPARK_DRIVER_PYTHON=C:\project\your_venv\Scripts\python.exe - 排查IDE运行配置覆盖问题
如果使用PyCharm、VS Code等IDE运行代码,检查对应运行配置里的环境变量项,确认没有把PYSPARK_PYTHON覆盖为系统默认的Microsoft Store Python别名路径。
根因说明:Spark DataFrame转Pandas的逻辑在Driver进程内执行,用的是当前启动脚本的Python环境;UDF计算由Spark单独拉起Python Worker子进程执行,Windows下子进程不会自动继承虚拟环境激活后的PATH配置,找不到对应Python解释器就会触发该报错。
内容的提问来源于stack exchange,提问作者Makkool
相关产品推荐
相关产品推荐

