Scala加载CSV文件编译报错求助:Bad superClass for class Nothing$
嘿,我来帮你搞定这个棘手的问题!你遇到的Error:scalac: Error while emitting RddWithCsvFile.scala assertion failed: Bad superClass for class Nothing$看起来有点莫名其妙,但根源其实是Scala和Spark的版本完全不兼容。
核心原因
Spark 2.1.0是一个比较老旧的版本,它的官方支持的Scala版本只有2.11.x系列,完全不兼容Scala 2.13.x。你现在用Scala 2.13.3搭配Spark 2.1.0,这种跨版本的组合会让Scala编译器在处理Spark的字节码时出现内部逻辑冲突,进而抛出这种奇怪的断言失败错误——这不是你的代码写错了,是环境版本不匹配导致的。
解决方案
你有两个可行的修复方向,选一个适合你的:
方案一:降级Scala版本到Spark 2.1.0支持的范围
把你的Scala版本改成2.11.12(这是Spark 2.x生态里最稳定的Scala版本之一),同时确保Maven依赖中Spark相关的artifactId后缀是_2.11(比如spark-sql_2.11),这样所有依赖版本就能对齐了。
方案二:升级Spark版本以支持Scala 2.13
如果不想降级Scala,可以把Spark升级到3.0.0及以上版本——Spark从3.0开始正式支持Scala 2.13。你的JDK 1.8是符合Spark 3.x的要求的,而且你这段简单的加载CSV的代码几乎不需要调整就能在新版本Spark上运行。
额外小提示
作为Spark新手,其实更推荐你用Spark 3.x搭配Scala 2.13/2.12来学习:新版本不仅bug更少,文档更完善,还支持很多实用的新特性。另外,加载CSV文件其实用Spark SQL的spark.read.csv()API会更省心(能自动处理表头、类型推断等),不过你现在在学习RDD基础,用textFile练手也完全没问题~
内容的提问来源于stack exchange,提问作者Saurabh Jhunjhunwala

