使用spark-submit运行含外部Python依赖脚本遇numpy导入错误求解决
你的问题核心是带C扩展的Python库(比如numpy)无法通过普通zip包在Spark分布式环境中正确加载——numpy的multiarray是二进制扩展模块,普通zip压缩后Python无法直接从包内读取这类.so文件,导致导入失败。下面是几个无需大幅修改业务代码的解决方案:
方案1:用conda-pack打包完整可移植环境(最推荐)
conda-pack可以把整个conda环境打包成一个tar.gz,包含所有编译好的依赖(包括C扩展模块),能在Spark的分布式节点上直接使用,几乎不用改业务代码:
创建并打包conda环境
# 创建专门的Spark运行环境(根据你的Python版本调整) conda create -n spark-run-env python=3.7 -y conda activate spark-run-env # 安装所有需要的依赖 pip install pandas numpy tensorflow scikit-learn tqdm # 打包环境 conda pack -o spark-env.tar.gz提交Spark任务时指定环境包
spark-submit --archives spark-env.tar.gz#env /home/ion/Documents/sentiment_analysis/test.py在test.py开头添加几行环境激活代码(不影响业务逻辑)
在你的test.py最顶部加入以下代码,让每个Executor加载打包的环境:import sys import os # 定位到解压后的环境site-packages目录(根据你的Python版本调整路径) env_site_packages = os.path.join(os.environ['SPARK_LOCAL_DIRS'], 'env/lib/python3.7/site-packages') sys.path.insert(0, env_site_packages)
方案2:修改依赖包的打包/加载方式
如果不想用conda,你可以避免把二进制模块放进zip,改用本地解压的方式:
在所有Spark节点上统一部署依赖
把你的dependencies.zip解压到所有Spark节点的同一个路径,比如/opt/spark-shared-deps:# 在每个节点执行(或者用集群管理工具批量部署) unzip /path/to/dependencies.zip -d /opt/spark-shared-deps提交任务时指定依赖路径
提交时通过配置让Executor的Python路径指向这个目录:spark-submit \ --conf spark.executorEnv.PYTHONPATH=/opt/spark-shared-deps \ /home/ion/Documents/sentiment_analysis/test.py这种方式完全不需要修改你的业务代码。
方案3:在Spark集群的Python环境中预安装依赖(最简单,若有权限)
如果你能访问所有Spark节点的Python环境,直接在每个节点上安装所需依赖:
# 在每个Spark节点执行 pip install pandas numpy tensorflow scikit-learn tqdm
之后直接提交任务即可,不需要带--py-files参数,也完全不用改代码:
spark-submit /home/ion/Documents/sentiment_analysis/test.py
为什么你的原有方式会失败?
numpy的multiarray是编译后的C扩展模块(以.so文件形式存在),Python无法从普通的zip压缩包中加载这类二进制文件——只有纯Python文件可以直接从zip包导入,带C扩展的库必须放在本地文件系统中才能被正确加载。
内容的提问来源于stack exchange,提问作者user9316498

