Athena(Presto SQL)如何存储公共子查询结果到变量避免重复查询
Athena 复用重复子查询的实现方法
完全可以实现,Athena基于Presto/Trino引擎,原生支持*CTE(公共表表达式)*语法,可以把重复使用的子查询逻辑抽成独立的临时结果块,后续查询直接引用即可,既不用重复写相同代码,SQL结构也会清晰很多。
补充说明:常规场景下Athena的查询优化器会自动识别相同的过滤逻辑,不会重复扫描源表数据;如果过滤后的子集数据量极大、且被多次引用,你也可以选择创建临时表存储子集,确保只计算一次。
写法示例
把你重复写的select * from tablename where x=y抽离为公共的CTE节点,改造后的SQL如下:
WITH -- 这里就是可复用的筛选数据子集,仅需编写一次 var AS ( SELECT * FROM tablename WHERE x = y ), p AS ( SELECT item, MAX(date) AS max_date FROM var GROUP BY 1 ), q AS ( SELECT item, date, MAX(date2) AS max_date2 FROM var GROUP BY 1,2 ) SELECT * FROM p LEFT JOIN q ON p.item = q.item;
这里的var就是你需要的类似变量效果的结果集,在单条SQL的执行生命周期内可以被任意后续节点引用。后续如果要调整x=y的过滤规则,只需要修改var节点内的一处代码即可,不用在多个子查询里同步修改。
大数据量下的优化方案
如果过滤后的子集数据量很大,且你需要在同一会话的多条SQL里重复使用这个子集,可以创建临时表存储结果,完全避免重复计算:
-- 第一步:创建会话级临时表,存储筛选后的子集 CREATE TEMPORARY TABLE var AS SELECT * FROM tablename WHERE x = y; -- 第二步:后续所有同会话的查询都可以直接引用var表 WITH p AS ( SELECT item, MAX(date) AS max_date FROM var GROUP BY 1 ), q AS ( SELECT item, date, MAX(date2) AS max_date2 FROM var GROUP BY 1,2 ) SELECT * FROM p LEFT JOIN q ON p.item = q.item;
临时表仅在当前查询会话生效,会话断开后会自动删除,不会产生额外的永久存储成本。
内容的提问来源于stack exchange,提问作者Devarshi Goswami
相关产品推荐
相关产品推荐

