如何用pandas json_normalize生成含workspace_id的数据集关联表?
问题描述
我有一个嵌套Python字典,希望将其转换为关系型数据模型,需要解析为通过workspace_id关联的「workspace」表和「datasets」表。

示例嵌套字典如下:
simplified_dict ={ "workspaces":[ { "workspace_id":"d507422c", "workspace_name":"Workspace 1", "datasets":[ { "dataset_id":"e7e8a355", "dataset_name":"Dataset 1 in workspace 1" }, { "dataset_id":"bbe8a355", "dataset_name":"Dataset 2 in workspace 1" } ] }, { "workspace_id":"etyyy422c-8d6d", "workspace_name":"Workspace 2", "datasets":[ { "dataset_id":"89jke8a355", "dataset_name":"Dataset 3 in Workspace 2" }, { "dataset_id":"tyii8a355", "dataset_name":"Dataset 4 in workspace 2" } ] } ], "datasourceInstances":[ ] }
我已通过pandas的json_normalize函数生成了包含工作区信息的表:
import pandas as pd df_workspaces = pd.json_normalize(simplified_dict, record_path=['workspaces']) df_workspaces
但使用同一函数生成「datasets」表时,得到的DataFrame缺少用于关联两张表的workspace_id字段:
df_datasets_in_workspaces = pd.json_normalize(simplified_dict, record_path=['workspaces','datasets']) df_datasets_in_workspaces
请问是否可以在仍使用json_normalize函数的前提下,为该数据集表添加workspace_id字段以实现表关联?由于我的真实数据有5层嵌套,需要生成约15张表,因此更倾向于使用json_normalize的低代码直观方案,而非循环或推导式。
解决方案
可以直接用json_normalize的meta参数解决这个问题,该参数专门用于提取父层级的字段作为附加列,完全适配多层嵌套场景。
生成带workspace_id的datasets表代码如下:
df_datasets_in_workspaces = pd.json_normalize( simplified_dict, record_path=['workspaces', 'datasets'], meta=[['workspaces', 'workspace_id']] )
如果需要去掉列名的嵌套前缀,可直接重命名:
df_datasets_in_workspaces.rename(columns={'workspaces.workspace_id': 'workspace_id'}, inplace=True)
对于5层嵌套的复杂数据,只需按层级路径在meta参数中指定需要提取的父级字段即可,全程无需循环或推导式,保持低代码的直观性。
内容的提问来源于stack exchange,提问作者Steve
相关产品推荐
相关产品推荐

