SparkSession调用textFile报AttributeError错误问题求助
报错根因
textFile 是SparkContext类的专属方法,SparkSession本身没有封装这个方法,你需要先从SparkSession实例中调取内置的SparkContext对象再使用该方法。
修复代码
将调用textFile的行修改为如下内容即可解决属性不存在的报错:
lines = spark.sparkContext.textFile('C:/Users/file.xlsx')
注意:你代码里写的文件后缀是
xslx,属于拼写错误,正确的Excel文件后缀为xlsx,请确认你的本地文件实际后缀后修正路径。
额外注意事项
textFile仅适用于读取纯文本格式文件(如txt、csv、json等文本类存储文件),如果读取的是二进制格式的Excel文件,最终会得到乱码结果,无法正常解析内容。- 如果你确实需要读取Excel文件,可以使用pyspark专用的Excel数据源扩展,读取后可直接得到结构化的DataFrame对象,无需自行解析文本内容。
内容的提问来源于stack exchange,提问作者Samuel
相关产品推荐
相关产品推荐

