Spark中repartition结合XML文件保存未生成预期多文件问题排查
问题:Spark DataFrame保存为XML时未按预期分区生成多文件
我有一个DataFrame,希望将其按first_name划分目录,每个目录下生成多个不超过5条记录的XML文件,编写的代码如下:
employees .repartition(col("first_name")) .write() .option("maxRecordsPerFile", 5) .mode(SaveMode.Overwrite) .partitionBy("first_name") .format("xml") .save("C:/spark_output/");
预期输出结构:
spark_output/ first_name=Alex part-00000.xml part-00001.xml first_name=Mike part-00000.xml part-00001.xml first_name=Nicole part-00000.xml part-00001.xml
但实际输出仅生成一个包含10行记录的XML文件,请求解决办法。
解决办法
1. 移除冗余的repartition操作
你同时使用了repartition(col("first_name"))和write.partitionBy("first_name"),这会导致分区逻辑冲突:write.partitionBy会自动根据指定列重新组织数据并写入对应目录,提前的repartition会让每个first_name仅对应一个Spark分区,反而限制了文件拆分的可能性。直接移除repartition(col("first_name"))即可。
2. 确认XML数据源版本与参数支持
Spark原生不支持XML格式,你使用的应该是com.databricks.spark.xml依赖。旧版本的该依赖可能不支持maxRecordsPerFile参数,建议升级到0.15.0及以上版本,确保参数能正常生效。
3. 显式配置XML标签(可选但推荐)
为了保证每个拆分后的XML文件都是合法文档,建议添加根节点和行标签的配置:
employees .write() .option("maxRecordsPerFile", 5) .option("rootTag", "employees") // 根节点标签 .option("rowTag", "employee") // 每行数据的标签 .mode(SaveMode.Overwrite) .partitionBy("first_name") .format("xml") .save("C:/spark_output/");
4. 强制拆分分区(如果仍未生效)
如果某个first_name对应的记录数较多,但还是只生成一个文件,可以通过repartition给每个first_name分配多个分区,强制拆分文件:
// 假设每个first_name最多有10条记录,设置每个first_name对应2个分区 employees .repartition(2, col("first_name")) // 第一个参数是每个first_name的分区数 .write() .option("maxRecordsPerFile", 5) .option("rootTag", "employees") .option("rowTag", "employee") .mode(SaveMode.Overwrite) .partitionBy("first_name") .format("xml") .save("C:/spark_output/");
内容的提问来源于stack exchange,提问作者Nemanja
相关产品推荐
相关产品推荐

