嵌套JSON数据标准化:Pandas json_normalize处理隧道字段异常问题
解决json_normalize处理嵌套列表字段(tunnels-in/tunnels-out)的问题
嘿,我懂你这种卡在嵌套列表字段上的头疼!咱直接上解决方案,分两种场景帮你搞定tunnels-in和tunnels-out这两个难搞的嵌套列表:
场景1:先拿到基础Flow数据,再展开嵌套隧道字段
如果你已经通过json_normalize(json_dict['data']['viptela-oper-vpn']['dpi']['flows'])拿到了基础的Flow DataFrame,但tunnels-in/tunnels-out还是存成列表格式,就用下面的步骤拆分:
- 拆分列表为单独行:用
explode把每个列表元素拆成独立行,同时保留原Flow的其他字段 - 展开嵌套字典:对拆分后的隧道字段用
json_normalize展开成结构化列
代码示例:
import pandas as pd from pandas.io.json import json_normalize # 先获取基础Flow数据 flows_df = json_normalize(json_dict['data']['viptela-oper-vpn']['dpi']['flows']) # 处理tunnels-in字段 # 第一步:把列表拆成单行 tunnels_in_exploded = flows_df.explode('tunnels-in').reset_index(drop=True) # 第二步:展开嵌套字典(跳过NaN行,避免报错) tunnels_in_normalized = json_normalize(tunnels_in_exploded['tunnels-in'].dropna().tolist()) # 第三步:合并原数据和展开的隧道数据 final_df = pd.concat([tunnels_in_exploded.drop('tunnels-in', axis=1), tunnels_in_normalized], axis=1) # 同理处理tunnels-out字段,重复上述步骤即可
场景2:直接展开隧道字段,同时保留Flow元数据
如果你想一步到位,直接把每个隧道条目作为一行,同时关联所属Flow的关键信息(比如flow-id、协议等),可以用json_normalize的record_path和meta参数,精准指定要展开的嵌套列表和要保留的元数据:
代码示例:
# 直接展开tunnels-in,同时保留Flow的核心字段 tunnels_in_full_df = json_normalize( # 原始数据路径 json_dict['data']['viptela-oper-vpn']['dpi']['flows'], # 指定要展开的嵌套列表字段 record_path='tunnels-in', # 指定要保留的Flow元数据(替换成你实际需要的字段) meta=['flow-id', 'protocol', 'source-ip', 'destination-ip'] ) # tunnels-out的处理完全一样,只需要把record_path改成'tunnels-out'即可 tunnels_out_full_df = json_normalize( json_dict['data']['viptela-oper-vpn']['dpi']['flows'], record_path='tunnels-out', meta=['flow-id', 'protocol', 'source-ip', 'destination-ip'] )
注意事项
- 如果
tunnels-in/tunnels-out存在空列表的情况,dropna()会自动跳过这些行,避免json_normalize报错 - 用
explode的方式会让原Flow的字段重复(每个隧道条目对应一行原Flow数据),如果不需要重复数据,优先用record_path+meta的方式 - 如果隧道字段还有更深层次的嵌套,可以在
json_normalize里用sep参数指定嵌套字段的分隔符(比如sep='_',把嵌套键变成tunnel_info_id这种格式)
内容的提问来源于stack exchange,提问作者pastthedawn
相关产品推荐
相关产品推荐

