You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark如何解析嵌套JSON并展开array类型的results字段为DataFrame

问题原因

你遇到的报错是因为results字段是数组(Array)类型,而字段名.*的展开语法仅支持结构体(Struct)类型,无法直接作用于数组,所以需要先把数组元素拆分为独立行再展开结构体。

Spark 实现代码(PySpark)

步骤1:导入依赖函数

from pyspark.sql.functions import explode

步骤2:拆分数组并展开字段

# 先将results数组炸开,每行对应数组中的一个struct元素,同时保留count列
df_exploded = df.select("count", explode("results").alias("result_struct"))

# 展开struct的所有子字段,得到目标格式
final_df = df_exploded.select("count", "result_struct.*")

验证结果

可以执行以下语句校验输出是否符合预期:

# 打印Schema确认字段结构
final_df.printSchema()
# 查看前20行数据
final_df.show()

可选:Spark SQL 写法

如果你习惯用SQL语法,也可以创建临时视图后执行以下查询:

-- 先注册临时视图
df.createOrReplaceTempView("raw_data")

-- 执行查询得到结果
SELECT 
  count,
  result_struct.*
FROM (
  SELECT 
    count,
    explode(results) AS result_struct
  FROM raw_data
) t

内容的提问来源于stack exchange,提问作者Mateusz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 06:27:01