Spark SQL的SELECT子句中如何为数值字段创建分组区间
现有写法错误说明
你编写的SQL存在多处语法和逻辑错误,无法正常运行,核心问题如下:
- 语法结构混乱:SQL关键字顺序完全错误,出现两处
FROM子句、多余的闭合括号,CASE逻辑的位置不符合SELECT子句规范 - 聚合规则不匹配:SELECT子句中出现了
vl_ren、max_t0两个非聚合字段,但这两个字段没有出现在GROUP BY中,不符合Spark SQL的聚合语法要求 - 别名冲突:子查询使用了和字段名相同的
vl_ren作为别名,会导致字段识别异常 - 逻辑不一致:原统计逻辑按
max_t0分组,新写法的GROUP BY中删除了该字段,若业务上不需要该分组维度可忽略,否则会导致统计结果不符合预期
修正后的实现方案
基础CASE写法修正版
如果要保留你原来的CASE区间逻辑,正确写法如下(用CTE避免重复写CASE逻辑):
%%time %%spark vlren = spark.sql(''' WITH tmp AS ( SELECT dt_mvtc, CASE WHEN vl_ren >= 0 AND vl_ren < 1000 THEN 0 WHEN vl_ren >= 1000 AND vl_ren < 2000 THEN 1 WHEN vl_ren >= 2000 AND vl_ren < 3000 THEN 2 WHEN vl_ren >= 3000 THEN 3 END AS vl_ren_range, max_t0, max_12, cd_cli FROM sbx_d4n0cbf.renda_presumida ) SELECT dt_mvtc, vl_ren_range, max_t0, max_12, COUNT(cd_cli) AS count_cd_cli FROM tmp GROUP BY dt_mvtc, vl_ren_range, max_t0, max_12 ORDER BY dt_mvtc ''')
如果不需要按max_t0分组,直接删除SELECT和GROUP BY中的max_t0字段即可。
更优实现方案
等距区间数学计算法
你的区间是步长为1000的等距区间,可以直接用数学计算代替CASE语句,代码更简洁,调整步长时也不用修改大量条件:
vlren = spark.sql(''' SELECT dt_mvtc, CAST(FLOOR(vl_ren / 1000) AS INT) AS vl_ren_range, max_t0, max_12, COUNT(cd_cli) AS count_cd_cli FROM sbx_d4n0cbf.renda_presumida WHERE vl_ren >= 0 GROUP BY dt_mvtc, CAST(FLOOR(vl_ren / 1000) AS INT), max_t0, max_12 ORDER BY dt_mvtc ''')
计算结果和CASE写法完全一致,后续要调整步长只需修改除数即可,比如步长改为2000就把1000替换为2000。
分桶函数法
如果是自定义非等距区间,可使用Spark SQL原生的width_bucket分桶函数,执行效率比手写CASE更高:
vlren = spark.sql(''' SELECT dt_mvtc, width_bucket(vl_ren, 0, 3000, 3) - 1 AS vl_ren_range, max_t0, max_12, COUNT(cd_cli) AS count_cd_cli FROM sbx_d4n0cbf.renda_presumida WHERE vl_ren >= 0 GROUP BY dt_mvtc, width_bucket(vl_ren, 0, 3000, 3) - 1, max_t0, max_12 ORDER BY dt_mvtc ''')
width_bucket的四个参数分别为:待分桶字段、分桶最小值、分桶最大值、最小值到最大值之间的桶数,减1是为了和你原来的0开头区间编号保持一致。
内容的提问来源于stack exchange,提问作者Silvio sjsj
相关产品推荐
相关产品推荐

