You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark中使用KMeans构建聚类模型报错maxBlockSizeInMB不存在,如何解决?

解决KMeans聚类模型报错Param maxBlockSizeInMB does not exist的方案

问题根源

Python环境中安装的PySpark版本与大数据集群上的Spark(Java/Scala)版本不兼容,maxBlockSizeInMB参数仅在特定版本的Spark中存在,版本不匹配时就会触发这个参数找不到的错误。

具体解决步骤

  • 确认集群Spark版本
    登录集群执行命令查看版本:

    spark-submit --version
    

    或在Spark Shell中执行:

    spark.version
    
  • 对齐PySpark版本
    卸载当前环境中的PySpark,安装与集群版本完全一致的PySpark包:

    pip uninstall pyspark -y
    pip install pyspark==<集群Spark版本号>
    

    示例:若集群是3.3.0版本,执行pip install pyspark==3.3.0

  • 验证版本匹配
    在Python脚本中添加代码确认版本:

    import pyspark
    print(pyspark.__version__)
    

    确保输出版本与集群Spark版本完全一致。

  • 清理缓存并重新运行
    清理Python环境缓存后,重新执行KMeans训练脚本,避免旧版本残留影响。


内容的提问来源于stack exchange,提问作者King Chudi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.09 05:08:17