如何配置Spark默认从HDFS读取数据并简化文件路径?
简化Spark读取HDFS路径的配置方法
配置文件位置
Spark的核心配置文件放在Spark安装目录下的conf文件夹里,需要修改的是spark-defaults.conf。如果该文件不存在,直接复制同目录下的spark-defaults.conf.template模板文件,重命名为spark-defaults.conf即可。
具体设置步骤
打开
spark-defaults.conf,添加以下配置项:spark.hadoop.fs.defaultFS hdfs://localhost:9000这个配置会把Spark的默认文件系统指定为你的HDFS地址,之后用相对路径(比如
/user/dat/test.txt)时,Spark会自动补全为完整的HDFS路径。保存配置后,重启Spark相关服务(包括集群服务、Spark Shell或你用的Notebook运行环境),确保配置生效。
验证效果
配置生效后:
- 读取HDFS文件时,直接写
spark.read.load("/user/dat/test.txt")就行,不用手动加hdfs://localhost:9000前缀; - 读取本地文件时,依然可以用
spark.read.load("file:///path/to/your/local/file.txt")的方式正常访问,Spark会识别file://协议并读取本地文件系统内容。
内容的提问来源于stack exchange,提问作者Trần Quang Đạt
相关产品推荐
相关产品推荐

