如何将嵌套JSON转换为指定结构的Pandas DataFrame?
如何将嵌套JSON转换为指定结构的Pandas DataFrame?
你现在面对的是一个典型的嵌套JSON展开问题,先明确下你的输入和目标:
输入JSON结构
response.json()返回的JSON格式如下:
{ "workbooks": [ { "name": "WORKBOOK_A", "embeddedDatasources": [ { "upstreamTables": [{"name": "WORKBOOK_A_TABLE_A"}]}, { "upstreamTables": [ {"name": "WORKBOOK_A_TABLE_B"}, {"name": "WORKBOOK_A_TABLE_C"}]}, {"upstreamTables": []}]}, { "name": "WORKBOOK_B", "embeddedDatasources": [ { "upstreamTables": [ {"name": "WORKBOOK_B_TABLE_A"}, {"name": "WORKBOOK_B_TABLE_B"}]}, { "upstreamTables": [ {"name": "WORKBOOK_B_TABLE_C"}, {"name": "WORKBOOK_B_TABLE_D"}]}]}]}
目标DataFrame结构
你希望转换成如下结构的DataFrame,同时忽略空的upstreamTables条目:
| workbooks | upstreamTables |
|---|---|
| WORKBOOK_A | WORKBOOK_A_TABLE_A |
| WORKBOOK_A | WORKBOOK_A_TABLE_B |
| WORKBOOK_A | WORKBOOK_A_TABLE_C |
| WORKBOOK_B | WORKBOOK_B_TABLE_A |
| WORKBOOK_B | WORKBOOK_B_TABLE_B |
| WORKBOOK_B | WORKBOOK_B_TABLE_C |
| WORKBOOK_B | WORKBOOK_B_TABLE_D |
确实直接用pd.json_normalize(json_data)会得到一堆嵌套列,完全不符合需求。我给你两个简单好用的解决方法:
方法一:手动遍历嵌套结构(直观易懂)
这种方法一步步拆解嵌套的JSON,逻辑清晰,哪怕JSON结构有小变动也容易调整:
import pandas as pd # 假设你的JSON数据已经存在变量json_data里了 result_rows = [] for workbook in json_data['workbooks']: workbook_name = workbook['name'] # 遍历每个嵌入式数据源 for datasource in workbook['embeddedDatasources']: upstream_tables = datasource['upstreamTables'] # 只处理非空的upstreamTables if upstream_tables: for table in upstream_tables: result_rows.append({ 'workbooks': workbook_name, 'upstreamTables': table['name'] }) # 转换为目标DataFrame final_df = pd.DataFrame(result_rows) print(final_df)
方法二:用json_normalize配合explode(更简洁)
其实json_normalize完全可以搞定,只是需要指定正确的参数,再配合explode展开嵌套列表:
import pandas as pd # 第一步:展开embeddedDatasources,同时保留workbook的名称作为元数据 df = pd.json_normalize( json_data['workbooks'], record_path='embeddedDatasources', # 要展开的嵌套列表路径 meta=['name'] # 要保留的顶层字段(作为workbooks列) ) # 第二步:展开upstreamTables列,把每个单独的table对象拆成一行 df = df.explode('upstreamTables').reset_index(drop=True) # 第三步:过滤空的upstreamTables条目,并提取table的名称 df = df[df['upstreamTables'].notna()] df['upstreamTables'] = df['upstreamTables'].apply(lambda x: x['name']) # 第四步:重命名列并整理最终结构 final_df = df.rename(columns={'name': 'workbooks'})[['workbooks', 'upstreamTables']] print(final_df)
两种方法最终都会生成你想要的DataFrame,完美匹配目标结构,同时自动跳过空的upstreamTables。
备注:内容来源于stack exchange,提问作者Matt Miles
相关产品推荐
相关产品推荐

