PySpark如何解析嵌套JSON并展开array类型的results字段为DataFrame
问题原因
你遇到的报错是因为results字段是数组(Array)类型,而字段名.*的展开语法仅支持结构体(Struct)类型,无法直接作用于数组,所以需要先把数组元素拆分为独立行再展开结构体。
Spark 实现代码(PySpark)
步骤1:导入依赖函数
from pyspark.sql.functions import explode
步骤2:拆分数组并展开字段
# 先将results数组炸开,每行对应数组中的一个struct元素,同时保留count列 df_exploded = df.select("count", explode("results").alias("result_struct")) # 展开struct的所有子字段,得到目标格式 final_df = df_exploded.select("count", "result_struct.*")
验证结果
可以执行以下语句校验输出是否符合预期:
# 打印Schema确认字段结构 final_df.printSchema() # 查看前20行数据 final_df.show()
可选:Spark SQL 写法
如果你习惯用SQL语法,也可以创建临时视图后执行以下查询:
-- 先注册临时视图 df.createOrReplaceTempView("raw_data") -- 执行查询得到结果 SELECT count, result_struct.* FROM ( SELECT count, explode(results) AS result_struct FROM raw_data ) t
内容的提问来源于stack exchange,提问作者Mateusz
相关产品推荐
相关产品推荐

