Spark 2.x中如何为独立的SQLContext配置Hadoop属性?
搞定Spark 2.x里SqlContext连接S3的配置问题
嘿,先给你提个小细节:你现在写的代码里两次调用SparkSession.builder().appName("myapp").getOrCreate(),这其实有点多余——Spark 2.x里SparkSession是统一的入口,sparkContext和sqlContext都是它的"下属",共享同一个配置上下文,根本不用分开创建两次Session。
正确的打开方式应该是先拿到唯一的SparkSession实例,再从它里面取sc和sqlContext:
// 先创建一个唯一的SparkSession实例 val spark = SparkSession.builder().appName("myapp").getOrCreate() // 从同一个Session里获取sc和sqlContext val sparkContext = spark.sparkContext val sqlContext = spark.sqlContext
这样一来,你给sparkContext.hadoopConfiguration设置的S3密钥参数,会自动被sqlContext继承,因为它们本来就是同一个应用上下文里的对象,配置是共享的。
如果真的需要单独给SqlContext对应的Hadoop配置做调整(其实一般没必要),你也可以直接通过sqlContext访问它关联的SparkContext的配置:
sqlContext.sparkContext.hadoopConfiguration.set("fs.s3n.awsAccessKeyId", "blah1") sqlContext.sparkContext.hadoopConfiguration.set("fs.s3n.awsSecretAccessKey", "blah 2")
不过更推荐的是在创建SparkSession的时候直接用config方法把参数加上,这样整个应用的配置一开始就到位,更简洁:
val spark = SparkSession.builder() .appName("myapp") .config("fs.s3n.awsAccessKeyId", "blah1") .config("fs.s3n.awsSecretAccessKey", "blah 2") .getOrCreate() val sqlContext = spark.sqlContext // 这会儿sqlContext已经能正常连接S3啦
最后补个小提示:如果你的Hadoop版本是2.7及以上,建议把s3n协议换成s3a,它的性能更好,还支持更多S3的特性哦~
内容的提问来源于stack exchange,提问作者hotmeatballsoup
相关产品推荐
相关产品推荐

