You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从嵌套JSON结构创建Spark DataFrame(Azure Synapse场景)

解决ExactOnline API嵌套JSON转PySpark DataFrame问题

你的问题核心是explode后得到的是struct类型列,需要将其字段展开为DataFrame的独立列,以下是在Azure Synapse PySpark环境中的完整实现:

完整代码实现

from pyspark.sql import functions as sf

# 读取数据湖中的多行JSON文件(替换为你的数据湖路径,格式为abfss://容器名@存储账户名.dfs.core.windows.net/文件路径)
df = spark.read.json("abfss://<container>@<storage-account>.dfs.core.windows.net/<path-to-your-json>")

# 提取d.results数组并展开为单行记录
df_exploded = df.select(sf.explode("d.results").alias("result"))

# 将struct类型的result列展开为独立列
final_df = df_exploded.select("result.*")

# 验证结果
final_df.show()

关键步骤说明

  1. 读取JSON:Spark默认支持每行一个JSON对象的格式,直接用spark.read.json读取数据湖路径即可,无需额外处理多行格式。
  2. 展开数组:通过sf.explode("d.results")将每行中的results数组拆分为多条记录,此时每条记录的result字段是一个包含所有目标列的struct类型。
  3. 展开struct字段:使用select("result.*")将struct中的所有键直接转为DataFrame的列,这一步对应你本地代码中pd.DataFrame(flat_data)的效果。

嵌套字段处理(可选)

如果result内部还有嵌套的struct字段,可通过点语法精准展开,例如:

# 展开嵌套字段
final_df = df_exploded.select(
    "result.id",
    "result.name",
    "result.details.address",
    "result.details.phone"
)

内容的提问来源于stack exchange,提问作者Psychotechnopath

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.13 23:15:46