Jupyter Notebook导入spark.implicits._报错,求可行解决方案
解决Jupyter Notebook中导入Spark Implicits的编译错误问题
这个问题我之前在Jupyter里用Spark Scala REPL时也踩过坑,和Zeppelin不同,Jupyter的REPL环境会把spark这类预定义变量包装在内部的动态结构里,导致spark.implicits无法被识别为稳定标识符,这就是你看到编译错误的原因。下面给你几个可行的解决办法:
办法一:重新绑定稳定的SparkSession引用
最简单的方式是把预定义的spark变量赋值给一个普通的val,这样编译器就能识别它的implicits了:
// 先在单元格里执行这两行 val sparkSession = spark import sparkSession.implicits._
之后你就可以正常使用$"my_column"语法来引用列了,比如:
val testDF = spark.read.csv("path/to/your/data.csv") testDF.select($"column_name").show()
办法二:直接导入SparkSession伴生对象的implicits
如果你的Spark版本是2.x及以上,可以跳过预定义的spark变量,直接导入伴生对象的implicits:
import org.apache.spark.sql.SparkSession.implicits._
这个方法适用于使用默认SparkSession的场景,如果你是自定义创建的Session,还是办法一更靠谱。
办法三:替代方案——使用col()函数
如果不想纠结导入的问题,也可以直接用Spark SQL提供的col()函数代替$"..."语法,效果完全一致,而且不需要导入任何implicits:
import org.apache.spark.sql.functions.col testDF.select(col("column_name")).show()
以上三种方法都能解决你遇到的问题,个人推荐办法一,它既保留了你习惯的$语法,又适配Jupyter的REPL环境。
内容的提问来源于stack exchange,提问作者WestCoastProjects
相关产品推荐
相关产品推荐

