You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Databricks中使用Kedro:无法导入SparkDataset

解决Databricks中无法导入SparkDataSet的问题

以下是针对导入失败问题的排查和解决步骤:

  • 检查Kedro版本,确认导入路径
    Kedro 0.18.0及以上版本对数据集结构做了调整,SparkDataSet从kedro.extras.datasets.spark迁移到了独立的kedro_datasets包中。

    • 先在Databricks notebook里执行!pip show kedro查看当前Kedro版本
    • 如果是0.18+版本,替换导入语句为:
      from kedro_datasets.spark import SparkDataSet
      
    • 旧版本(0.17.x及以下)则保留原导入路径,但需要确保安装了对应依赖。
  • 安装/更新必要的依赖包

    • 新版本Kedro需要单独安装数据集包,执行:
      %pip install kedro-datasets[spark]
      
    • 旧版本Kedro需要安装带Spark扩展的Kedro:
      %pip install kedro[spark]
      

    如果已经安装,尝试更新到兼容版本:

    %pip install --upgrade kedro kedro-datasets
    
  • 排查环境依赖冲突
    Databricks集群自带的部分库可能和Kedro依赖版本冲突,可执行以下命令查看已安装的相关包:

    !pip list | grep -E "kedro|pyspark"
    

    确保Kedro和PySpark版本兼容(Kedro 0.18+支持Spark 2.4及以上版本),若有冲突,可考虑在虚拟环境中隔离安装,或者联系集群管理员调整环境依赖。

  • 验证Spark环境可用性
    在notebook中执行spark.version确认Spark环境正常运行,确保集群已正确配置Spark服务。

内容的提问来源于stack exchange,提问作者Abhijit Das

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.17 01:25:37