Databricks环境下如何将PySpark DataFrame转换为Scala DataFrame
PySpark DataFrame 转 Scala DataFrame 操作步骤
在Databricks环境中不同语言的Spark运行时共享同一份SparkSession实例,你可以通过临时视图中转完成转换,操作如下:
- 首先在Python单元格中将已有的PySpark DataFrame注册为临时视图:
%python wordsDF.createOrReplaceTempView("temp_words_view")
- 之后在Scala单元格中读取该临时视图,即可得到Scala格式的DataFrame:
%scala val scalaWordsDF = spark.read.table("temp_words_view")
如果你需要跨会话共享该视图,可以注册全局临时视图,对应操作如下:
Python侧注册:wordsDF.createOrReplaceGlobalTempView("global_words_view")
Scala侧读取:val scalaWordsDF = spark.read.table("global_temp.global_words_view")
拿到scalaWordsDF之后你就可以正常执行写入Azure Data Lake Gen2的相关操作。
内容的提问来源于stack exchange,提问作者mmoayed
相关产品推荐
相关产品推荐

