无法将带header的JSON数据集导入Pandas的解决方案求助
解决方法
你的核心问题是没找对要解析的数据集位置,且用错了pd.read_json()的参数——这个函数不接受Python字典,只认文件路径、JSON字符串或类文件对象。
正确代码
直接提取字典里的obs数组(这才是实际的数据记录列表),用pd.json_normalize()解析嵌套结构:
import pandas as pd # 假设data是你已加载好的字典 df = pd.json_normalize(data['obs'])
执行后,每个嵌套字段(比如dataset.value、geography.description)会自动展开成单独的列,完美匹配你的需求。
为什么之前的方法失败
pd.read_json(data):传入了Python字典,而该函数要求的是文件路径/JSON字符串,直接报错pd.json_normalize([data]):把整个包含header和obs的大字典当成一条记录解析,结果只会把header和obs作为两列,不是你要的表格pd.DataFrame.from_dict(data):直接将顶层的header和obs转为列,列里是复杂的嵌套结构,无法生成可用的表格
可选:合并header信息到DataFrame
如果需要把header里的元数据(比如提取时间、数据源)合并到每一行记录里,可以这么做:
# 解析header为单行DataFrame header_df = pd.json_normalize(data['header']) # 复制header到每一行,和主数据合并 final_df = df.join(pd.concat([header_df]*len(df), ignore_index=True))
内容的提问来源于stack exchange,提问作者Matthew Justin
相关产品推荐
相关产品推荐

