You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Spark SQL中使用JSON Path:嵌套JSON提取与表定义技术问询

当然可以!Spark SQL完全支持借助JSON Path来提取嵌套JSON里的数据,不管是临时查询还是定义持久化表,都能实现你提到的需求——比如筛选出类别为reference的书籍作者这种场景。下面我分两种常见场景给你具体说明:

1. 在查询中直接用JSON Path提取数据

如果你的数据已经在Spark表中(比如某个列存的是完整的嵌套JSON字符串),可以用Spark内置的get_json_object函数结合JSON Path直接提取。

举个例子,先创建一张测试临时表:

CREATE TEMPORARY VIEW raw_books AS
SELECT '{"store": {"book": [{"category": "reference", "author": "Nigel Rees"}, {"category": "fiction", "author": "Evelyn Waugh"}]}}' AS json_content;

然后用你提到的JSON Path表达式查询:

SELECT get_json_object(json_content, '$.store.book[?(@.category == "reference")].author') AS reference_authors
FROM raw_books;

这条语句会返回字符串形式的数组结果:["Nigel Rees"]。如果想要把结果拆成单独的行(更适合后续分析),可以结合from_json和explode来解析并展开数组:

SELECT exploded_book.author
FROM raw_books
LATERAL VIEW explode(
  from_json(json_content, 'store struct<book:array<struct<category:string,author:string>>>').store.book
) exploded_books AS exploded_book
WHERE exploded_book.category = 'reference';

这样就能得到单独的作者行,结果更直观。

2. 基于JSON Path定义Spark表

如果需要把提取后的结果持久化为表,有两种实用方式:

方式一:创建外部表时直接指定JSON Path

如果你的数据源是外部JSON文件,可以在创建表时通过json_path参数指定提取规则,直接把符合条件的数据映射成表字段:

CREATE TABLE reference_book_authors (
  author ARRAY<STRING>
)
USING json
OPTIONS (
  path "/path/to/your/json/directory",
  json_path "$.store.book[?(@.category == 'reference')].author"
);

这里把字段类型设为ARRAY<STRING>,因为JSON Path返回的是数组结果;如果需要单值,也可以调整Path或者后续处理。

方式二:先解析再通过CTAS创建表

如果嵌套结构比较复杂,先创建视图解析完整的JSON结构,再用CREATE TABLE AS SELECT(CTAS)来生成目标表,这种方式更灵活易维护:

-- 第一步:创建视图解析完整嵌套结构
CREATE OR REPLACE VIEW parsed_books AS
SELECT
  from_json(json_content, 'store struct<book:array<struct<category:string,author:string>>>').store.book AS all_books
FROM raw_books;

-- 第二步:筛选目标数据并创建持久化表
CREATE TABLE reference_authors_table AS
SELECT book.author
FROM parsed_books
LATERAL VIEW explode(all_books) exploded AS book
WHERE book.category = 'reference';

小提示

  • Spark支持的JSON Path基本遵循标准规范,但有一些Spark特有的细节:比如字符串匹配要用双引号,在SQL语句里要注意转义(或者用单引号包裹整个JSON Path表达式)。
  • 对于复杂嵌套结构,优先用from_json结合结构化Schema解析成Spark的结构体/数组类型,再用常规SQL操作,比写超长的JSON Path更易读、更方便调试。

内容的提问来源于stack exchange,提问作者Abhay Dubey

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 10:10:41