PySpark中使用KMeans构建聚类模型报错maxBlockSizeInMB不存在,如何解决?
解决KMeans聚类模型报错
Param maxBlockSizeInMB does not exist的方案 问题根源
Python环境中安装的PySpark版本与大数据集群上的Spark(Java/Scala)版本不兼容,maxBlockSizeInMB参数仅在特定版本的Spark中存在,版本不匹配时就会触发这个参数找不到的错误。
具体解决步骤
确认集群Spark版本
登录集群执行命令查看版本:spark-submit --version或在Spark Shell中执行:
spark.version对齐PySpark版本
卸载当前环境中的PySpark,安装与集群版本完全一致的PySpark包:pip uninstall pyspark -y pip install pyspark==<集群Spark版本号>示例:若集群是3.3.0版本,执行
pip install pyspark==3.3.0验证版本匹配
在Python脚本中添加代码确认版本:import pyspark print(pyspark.__version__)确保输出版本与集群Spark版本完全一致。
清理缓存并重新运行
清理Python环境缓存后,重新执行KMeans训练脚本,避免旧版本残留影响。
内容的提问来源于stack exchange,提问作者King Chudi
相关产品推荐
相关产品推荐

