You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark SQL按多列执行partition by未达预期效果问题咨询

问题原因

你当前结果是row_number()函数的正常表现,该函数的特性是对同一个窗口分区内的所有行,生成唯一的连续整数序号。哪怕你order by指定的字段值完全相同,Spark也会按行的内部存储顺序分配不同序号,和partition by是否按年月分区无关。

适配方案

根据你的需求,有两种修改方式:

方案1:匹配示例输出,同用户、同退订年月、同留存年月的所有行序号相同

仅需将row_number()替换为dense_rank()即可,修改后代码如下:

dense_rank() over (
    partition by user_id,
                 cast(date_format(cancelation_date,'yyyyMM') as integer),
                 cast(date_format(retention_date,'yyyyMM') as integer)
    order by cast(date_format(cancelation_date,'yyyyMM') as integer) asc,
             cast(date_format(retention_date,'yyyyMM') as integer) asc
) as row_count

方案2:匹配补充说明,同一用户下同一退订年月的所有行序号相同

如果要求同一个用户的退订年月按升序编号,最早的退订年月所有记录编号为1,下一个退订年月所有记录编号为2,以此类推,需要调整窗口分区逻辑,仅按user_id分区即可,修改后代码如下:

dense_rank() over (
    partition by user_id
    order by cast(date_format(cancelation_date,'yyyyMM') as integer) asc
) as row_count

内容的提问来源于stack exchange,提问作者layal

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 15:24:03