如何用Python Apache Spark连接Redshift?附操作步骤与代码
基于《Spark Redshift with Python》的PySpark-Redshift连接实操
我正在跟着《Spark Redshift with Python》教程搭建PySpark与Redshift的连接,目前已经完成了这些准备和编码工作:
前期准备
- 创建了本地文件夹,用来存放JDBC驱动包和代码文件
- 下载了Redshift JDBC驱动包:
RedshiftJDBC42-1.2.12.1017.jar,并放到了刚才创建的文件夹里
编写连接代码(sample.py)
下面是我写的代码片段:
from pyspark.conf import SparkConf from pyspark.sql import SparkSession aws_access_key = "xxxx" aws_secret_key = "xxxxyyyy" bucket = "redshiftbucketadrian" spark = SparkSession.builder.master("yarn").appName("Connect to redshift").enableHiveSupport().getOrCreate() sc = spark.sparkContex...
内容的提问来源于stack exchange,提问作者Adam
相关产品推荐
相关产品推荐

