Synapse中Pyspark写入JSON时不硬编码如何保留原有列顺序
Pyspark写入JSON保留原始列顺序解决方案
Spark写入JSON文件时默认会将字段按字母序排序,因此会覆盖DataFrame原有的列顺序,无需硬编码列名的解决方法如下:
方法1(推荐,Spark 2.4及以上版本适用,Synapse默认Spark版本均支持)
直接在写入时添加sortFields参数,关闭自动排序即可:
df.coalesce(1).write.format("json") \ .mode("overwrite") \ .option("sortFields", "false") \ .save(dest_location)
方法2(适配低于2.4的Spark版本)
动态获取DataFrame原始列顺序,手动构造按指定顺序排列的JSON后写出:
import json # 自动获取原始列顺序,无需硬编码 original_cols = df.columns df.coalesce(1).toJSON() \ .map(lambda json_str: json.loads(json_str)) \ .map(lambda row_dict: {col: row_dict[col] for col in original_cols}) \ .map(lambda ordered_dict: json.dumps(ordered_dict)) \ .saveAsTextFile(dest_location, mode="overwrite")
内容的提问来源于stack exchange,提问作者Krishna
相关产品推荐
相关产品推荐

