You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将嵌套JSON转换为指定结构的Pandas DataFrame?

如何将嵌套JSON转换为指定结构的Pandas DataFrame?

你现在面对的是一个典型的嵌套JSON展开问题,先明确下你的输入和目标:

输入JSON结构

response.json()返回的JSON格式如下:

{
    "workbooks": [
        {
            "name": "WORKBOOK_A",
            "embeddedDatasources": [
                {
                    "upstreamTables": [{"name": "WORKBOOK_A_TABLE_A"}]},
                {
                    "upstreamTables": [
                        {"name": "WORKBOOK_A_TABLE_B"},
                        {"name": "WORKBOOK_A_TABLE_C"}]},
                {"upstreamTables": []}]},
        {
            "name": "WORKBOOK_B",
            "embeddedDatasources": [
                {
                    "upstreamTables": [
                        {"name": "WORKBOOK_B_TABLE_A"},
                        {"name": "WORKBOOK_B_TABLE_B"}]},
                {
                    "upstreamTables": [
                        {"name": "WORKBOOK_B_TABLE_C"},
                        {"name": "WORKBOOK_B_TABLE_D"}]}]}]}

目标DataFrame结构

你希望转换成如下结构的DataFrame,同时忽略空的upstreamTables条目:

workbooksupstreamTables
WORKBOOK_AWORKBOOK_A_TABLE_A
WORKBOOK_AWORKBOOK_A_TABLE_B
WORKBOOK_AWORKBOOK_A_TABLE_C
WORKBOOK_BWORKBOOK_B_TABLE_A
WORKBOOK_BWORKBOOK_B_TABLE_B
WORKBOOK_BWORKBOOK_B_TABLE_C
WORKBOOK_BWORKBOOK_B_TABLE_D

确实直接用pd.json_normalize(json_data)会得到一堆嵌套列,完全不符合需求。我给你两个简单好用的解决方法:

方法一:手动遍历嵌套结构(直观易懂)

这种方法一步步拆解嵌套的JSON,逻辑清晰,哪怕JSON结构有小变动也容易调整:

import pandas as pd

# 假设你的JSON数据已经存在变量json_data里了
result_rows = []
for workbook in json_data['workbooks']:
    workbook_name = workbook['name']
    # 遍历每个嵌入式数据源
    for datasource in workbook['embeddedDatasources']:
        upstream_tables = datasource['upstreamTables']
        # 只处理非空的upstreamTables
        if upstream_tables:
            for table in upstream_tables:
                result_rows.append({
                    'workbooks': workbook_name,
                    'upstreamTables': table['name']
                })

# 转换为目标DataFrame
final_df = pd.DataFrame(result_rows)
print(final_df)

方法二:用json_normalize配合explode(更简洁)

其实json_normalize完全可以搞定,只是需要指定正确的参数,再配合explode展开嵌套列表:

import pandas as pd

# 第一步:展开embeddedDatasources,同时保留workbook的名称作为元数据
df = pd.json_normalize(
    json_data['workbooks'],
    record_path='embeddedDatasources',  # 要展开的嵌套列表路径
    meta=['name']  # 要保留的顶层字段(作为workbooks列)
)

# 第二步:展开upstreamTables列,把每个单独的table对象拆成一行
df = df.explode('upstreamTables').reset_index(drop=True)

# 第三步:过滤空的upstreamTables条目,并提取table的名称
df = df[df['upstreamTables'].notna()]
df['upstreamTables'] = df['upstreamTables'].apply(lambda x: x['name'])

# 第四步:重命名列并整理最终结构
final_df = df.rename(columns={'name': 'workbooks'})[['workbooks', 'upstreamTables']]
print(final_df)

两种方法最终都会生成你想要的DataFrame,完美匹配目标结构,同时自动跳过空的upstreamTables。

备注:内容来源于stack exchange,提问作者Matt Miles

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.14 16:38:06