如何在Code Repositories中通过Java/Scala API获取Hadoop路径
Scala 实现方式
你可以直接调用输入数据集实例的filesystem()方法获取文件系统对象,再调用hadoopPath()拿到目标路径,示例如下:
// 已在Transform方法中注入输入数据集input、SparkSession实例spark val hadoopPath = input.filesystem().hadoopPath() // 读取JSON文件并自动推断Schema,读取XML/二进制等格式只需调整读取API即可 val df = spark.read.json(hadoopPath)
Java 实现方式
逻辑和Scala完全一致,对应方法调用如下:
// 已在Transform方法中注入输入数据集input、SparkSession实例spark String hadoopPath = input.filesystem().hadoopPath(); Dataset<Row> df = spark.read().json(hadoopPath);
获取到的路径为标准Foundry文件系统路径,格式与你需求中的foundry://...格式完全匹配,可直接传入Spark DataSource API使用,无需额外格式转换。
内容的提问来源于stack exchange,提问作者Mehdi
相关产品推荐
相关产品推荐

