PySpark连接Hive时无法识别已创建数据库的问题求助
PySpark连接Hive时无法识别已创建数据库的问题求助
我正在做Hadoop、Hive和Spark相关的工作,需要查询自己在Hive中创建的表。我尝试在Jupyter Notebook中用PySpark库连接Hive,代码如下:
import findspark findspark.init() from pyspark.sql import SparkSession from pyspark.conf import SparkConf spark = SparkSession.builder.appName("laboratorio2").config("hive.metastore.uris", "thrift://localhost:9083", conf=SparkConf()).enableHiveSupport().getOrCreate() spark.sql("show databases").show()
执行show databases后返回的结果只有默认库:
+------------+ |databaseName| +------------+ | default| +------------+
但实际上我在Hive里还创建了另一个数据库——直接在Hive命令行执行show databases;,能看到除了default外还有一个自定义的数据库。
我不确定自己的SparkSession配置是否正确,也试过不带任何额外配置创建SparkSession,但结果还是一样。有没有大佬知道怎么才能让PySpark连接到我已经创建好的数据库?补充一下,我用的Spark版本是2.4.7,工作环境是装了Ubuntu Server的虚拟机。
备注:内容来源于stack exchange,提问作者Javier Martinez Barriga
相关产品推荐
相关产品推荐

