You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何以JSON格式显示Spark DataFrame的部分行(替代表格格式)

以JSON格式查看Spark DataFrame部分数据行

当然可行,针对列多表格查看不便的情况,这几个实用方法能帮你快速以JSON格式展示指定行数的数据:

Python 实现

  • 直接打印指定行数的JSON格式数据:
# 取前5行转成JSON并逐行打印
for json_row in df.limit(5).toJSON().collect():
    print(json_row)

limit(5)用来控制要查看的行数,toJSON()会把DataFrame的每一行转换成标准JSON字符串,collect()将分布式的数据拉取到Driver端后,循环打印就能看到清晰的键值对结构,列再多也不会挤成一团。

  • 若想把JSON数据保存到文件离线查看:
# 把前5行数据以JSON格式写入指定路径
df.limit(5).write.json("/your/output/path")

执行后会生成一个目录,里面的文件每行都是一条JSON数据,适合需要留存查看的场景。

Scala 实现

如果用Scala开发,代码逻辑类似:

// 取前5行转JSON并打印
df.limit(5).toJSON.collect().foreach(println)

注意:collect()会将数据拉到Driver节点的内存中,所以不要设置过大的行数,避免内存溢出。

内容的提问来源于stack exchange,提问作者Santhosh

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.06 20:22:06