HDFS含逗号文件名的Spark指定文件读取问题咨询
解决Spark读取带逗号的HDFS文件路径问题
针对你遇到的Spark把带逗号的文件路径误分割的问题,我来逐一解答你的疑问:
1. 有办法转义路径中的逗号吗?
当然有,而且不止一种实用方案,这里推荐几个最稳妥的:
分别读取文件再合并
别把多个路径用逗号拼在同一个字符串里传给sc.textFile,而是单独读取每个文件,再用union合并RDD:val file1 = sc.textFile("hdfs://namespace/mypath/1-1,123") val file2 = sc.textFile("hdfs://namespace/mypath/1-2,124") val combinedRDD = file1.union(file2)这种方式完全避开了逗号作为路径分隔符的逻辑,适合任意带特殊字符的文件名。
使用通配符批量匹配(如果文件名有规律)
如果你的文件名有固定规律,可以用通配符精准匹配目标文件,不用逐个指定路径。比如针对你的示例,可尝试:val rdd = sc.textFile("hdfs://namespace/mypath/1-[12],12[34]")这里
[12]匹配1或2,[34]匹配3或4,能准确选中你需要的两个文件,同时不会触发逗号的分割逻辑。用wholeTextFiles读取(按需选择)
如果你需要同时获取文件名和内容,可以用sc.wholeTextFiles,它会把每个文件作为键值对(文件名 -> 文件内容)返回,之后再按需拆分内容:val filesRDD = sc.wholeTextFiles("hdfs://namespace/mypath/1-1,123,hdfs://namespace/mypath/1-2,124") val linesRDD = filesRDD.flatMap(_._2.split("\n"))注意这个方法会把整个文件内容加载到内存,更适合小文件场景。
2. 是否只能重命名源文件?
完全不需要重命名源文件!上面提到的几种方法都可以在保留原文件名的前提下,正常读取目标文件。重命名是最繁琐的方案,除非你有其他业务强制要求修改文件名,否则优先用上面的方法解决问题。
内容的提问来源于stack exchange,提问作者Ra41P
相关产品推荐
相关产品推荐

