You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用pandas.json_normalize展开CSV嵌套字典列并关联app_ID的求助

解决方案

你遇到的问题主要有两个:

  • 你数据中的locations字段值是JSON字符串格式,不是原生Python列表,直接调用json_normalize无法识别嵌套结构
  • 原始数据的app_ID和locations是按索引("0"、"1")一一对应的,你之前的写法没有先做字段关联,自然无法把app_ID和位置信息绑定

完整实现代码

import pandas as pd
import json

步骤1:加载原始数据并构造基础关联表

# 加载你的原始JSON数据
with open('location_json.json', 'r') as f:
    raw_data = json.load(f)

# 把按索引分组的原始数据转为基础表,每行对应一个app_ID
df_base = pd.DataFrame({
    "app_ID": raw_data["app_ID"],
    "locations": raw_data["locations"]
}).reset_index(drop=True)

步骤2:解析JSON字符串并展开嵌套结构

# 将locations列的JSON字符串转为Python列表
df_base["locations"] = df_base["locations"].apply(json.loads)

# 把列表展开为多行,每个位置对应一行,空列表会转为NaN
df_exploded = df_base.explode("locations", ignore_index=True)
# 去掉没有位置信息的空行,需要保留空app_ID的话可以删除这行
df_exploded = df_exploded.dropna(subset=["locations"]).reset_index(drop=True)

# 展开位置字典为独立列,关联对应app_ID
df_final = pd.json_normalize(df_exploded["locations"]).join(df_exploded["app_ID"])

执行完成后df_final就是你需要的目标结构。


补充说明

  • 如果你的原始数据是CSV格式,直接用df_base = pd.read_csv("你的数据集.csv", usecols=["app_ID", "locations"])替换步骤1的加载逻辑即可,后续解析、展开步骤完全通用
  • 该方案用pandas原生优化方法实现,无手动遍历循环,适合处理大型数据集

内容的提问来源于stack exchange,提问作者lbecker

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 23:24:03