You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python读取非常规JSON并转换为DataFrame的高效方法

高效转换非标准并列JSON为DataFrame的方案

嘿,这个场景我太熟悉了!这种多个独立JSON对象直接并列的非标准格式(说起来它其实很接近JSON Lines/NDJSON,只是没按行分隔),自己写循环处理不仅麻烦,数据量大的时候还特别慢。给你分享两个比循环高效得多的方案:

方案1:用Pandas直接处理(适合中小数据量)

Pandas的read_json其实支持处理逐行的JSON对象,我们只需要先把你的原始格式转换成每行一个JSON对象的形式,就能直接解析:

import pandas as pd
import re

# 假设你的原始JSON字符串是raw_json(如果是文件的话可以先读入)
raw_json = '{"K1": "V11", "K2": "V12", "K3": "V13"} {"K1": "V21", "K2": "V22", "K3": "V23"} {"K1": "V31", "K2": "V32", "K3": "V33"}'

# 把并列的"}{"替换成"}\n{",转换成JSON Lines格式
formatted_json = re.sub(r'}\s*{', '}\n{', raw_json)

# 用StringIO模拟文件流,lines=True表示每行一个JSON对象
df = pd.read_json(pd.io.common.StringIO(formatted_json), lines=True)
print(df)

这个方法依赖Pandas的矢量化处理,比手动循环快好几倍,代码也简洁。

方案2:流式JSON解析(适合超大文件/内存有限场景)

如果你的数据量特别大,一次性加载到内存会有压力,推荐用ijson这个流式解析库,它可以逐段读取并解析JSON对象,完全不用把整个文件加载到内存:

import ijson
import pandas as pd
from io import StringIO

raw_json = '{"K1": "V11", "K2": "V12", "K3": "V13"} {"K1": "V21", "K2": "V22", "K3": "V23"} {"K1": "V31", "K2": "V32", "K3": "V33"}'

# 用StringIO包装字符串(如果是文件的话直接传文件路径)
stream = StringIO(raw_json)
# multiple_values=True表示允许多个顶级JSON对象
objects = ijson.items(stream, '', multiple_values=True)

# 把生成器直接转成DataFrame
df = pd.DataFrame(objects)
print(df)

这个方案的内存效率极高,处理几个G的JSON文件都没问题,而且性能比手动循环好太多。

小提示

这种非标准格式本质上就是没有换行分隔的JSON Lines,只要处理好对象之间的分隔符,就能利用现成的高效工具来处理,完全不用自己写循环造轮子~

内容的提问来源于stack exchange,提问作者Priyanka Basu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 07:28:10