You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用PySpark扁平化带动态数字键的嵌套JSON并保留键为列

解决PySpark扁平化嵌套JSON时丢失数字键的问题

你的问题出在inline(response.result)只会展开result数组的元素值,但每个元素是包含动态数字键(比如1234568895)的结构体,这个方法无法保留键本身。要得到包含id(对应数字键)、Card、Card_Number1的结构化DataFrame,需要分三步处理:

完整解决方案代码

from pyspark.sql import SparkSession
from pyspark.sql.functions import explode, map_from_entries, array, struct, lit, col

spark = SparkSession.builder.appName("NestedJSONExample").getOrCreate()

# 读取JSON数据(注意:JSON文件不需要header,这里去掉header参数)
df = spark.read.format("json").option("multiLine", True).load("Files.json")

# 1. 展开response.result数组,得到每个带数字键的结构体
df_result = df.select(explode("response.result").alias("result_struct"))

# 2. 提取结构体的数字键和对应数组,转成(id, card_array)的行
# 先自动获取所有数字键列名
struct_columns = df_result.select("result_struct.*").columns
# 将每个键值对转成(key, value)结构,再转成map并展开
df_key_value = df_result.select(
    explode(
        map_from_entries(
            array(*[struct(lit(k).alias("key"), col(f"result_struct.{k}").alias("value")) for k in struct_columns])
        )
    ).alias("id", "card_array")
)

# 3. 展开card数组,提取里面的Card、Card_Number1等字段
final_df = df_key_value.select(
    "id",
    explode("card_array").alias("card_details")
).select(
    "id",
    "card_details.Card",
    "card_details.Card_Number1"
    # 有其他字段的话直接在这里添加,比如card_details.Other_Field
)

final_df.show()

关键步骤说明

  1. 展开result数组:用explode("response.result")把嵌套的数组拆成单独的行,每行对应一个包含数字键的结构体。
  2. 保留数字键并关联数组:通过map_from_entries把结构体的动态数字键和对应数组转成键值对map,再用explode拆成id(原数字键)和card_array(对应数组)的行。
  3. 展开卡片数组并提取字段:最后把card_array展开,同时保留id,再提取数组元素里的Card、Card_Number1等字段。

为什么原代码失效

inline(response.result)只能将数组元素(结构体)的字段直接展开为列,但这些列是数字键对应的数组值,完全丢失了数字键本身,所以你只能看到数组内容而看不到对应的id。

内容的提问来源于stack exchange,提问作者Jannu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.19 01:15:55