如何以JSON格式显示Spark DataFrame的部分行(替代表格格式)
以JSON格式查看Spark DataFrame部分数据行
当然可行,针对列多表格查看不便的情况,这几个实用方法能帮你快速以JSON格式展示指定行数的数据:
Python 实现
- 直接打印指定行数的JSON格式数据:
# 取前5行转成JSON并逐行打印 for json_row in df.limit(5).toJSON().collect(): print(json_row)
limit(5)用来控制要查看的行数,toJSON()会把DataFrame的每一行转换成标准JSON字符串,collect()将分布式的数据拉取到Driver端后,循环打印就能看到清晰的键值对结构,列再多也不会挤成一团。
- 若想把JSON数据保存到文件离线查看:
# 把前5行数据以JSON格式写入指定路径 df.limit(5).write.json("/your/output/path")
执行后会生成一个目录,里面的文件每行都是一条JSON数据,适合需要留存查看的场景。
Scala 实现
如果用Scala开发,代码逻辑类似:
// 取前5行转JSON并打印 df.limit(5).toJSON.collect().foreach(println)
注意:
collect()会将数据拉到Driver节点的内存中,所以不要设置过大的行数,避免内存溢出。
内容的提问来源于stack exchange,提问作者Santhosh
相关产品推荐
相关产品推荐

