Azure Data Flow如何筛选重复ID中seq_no最大的记录
在Azure Data Flow中提取重复ID记录里seq_no最大的条目
你可以通过以下步骤实现需求:
添加窗口转换(Window Transformation):
- 窗口类型选择「分组窗口(Group by window)」,将你的ID列设为分组键(比如
id)。 - 在窗口列中新增一列(比如命名为
max_seq_no),使用max(seq_no)函数计算每个ID组内seq_no的最大值。
- 窗口类型选择「分组窗口(Group by window)」,将你的ID列设为分组键(比如
添加筛选转换(Filter Transformation):
- 设置筛选条件为
seq_no == max_seq_no,这样就能保留每个ID组中seq_no等于最大值的记录。
- 设置筛选条件为
如果存在同一个ID下多条记录seq_no同为最大值的情况,想要确保每个ID只留一条,可以额外加两步:
添加排序转换(Sort Transformation):
- 先按ID列排序,再按seq_no列降序排序。
添加排名转换(Rank Transformation):
- 排名键选择ID列,排序规则选择seq_no降序,排名类型选「唯一排名(Unique rank)」。
- 最后再用筛选转换,保留排名等于1的记录即可。
内容的提问来源于stack exchange,提问作者user19504539
相关产品推荐
相关产品推荐

