使用dplyr按年份分组提取最高退款月份及金额的问题
解决按年份分组获取最高退款对应月份的问题
嗨,我来帮你搞定这个需求!你当前的代码已经成功提取了每年的最高退款金额,但要同时拿到对应的月份,我们可以用dplyr的几个简单方法来实现:
方法1:使用slice_max(推荐)
slice_max是dplyr专门设计用来提取分组内最大行的函数,用法非常直观,能直接保留完整的对应记录:
RefTable <- returns_data %>% group_by(Year) %>% # 按Ref列降序,每个分组取前1行(即退款最高的那行) slice_max(order_by = Ref, n = 1) %>% # 取消分组,避免后续操作受分组影响 ungroup()
如果某一年有多个月份的退款金额并列最高,你可以把n的值调整为对应的数字(比如n=2),就能把所有并列最高的记录都取出来。
方法2:使用filter配合max
另一种思路是在分组后,筛选出退款金额等于该组最大值的行,同样能得到对应月份:
RefTable <- returns_data %>% group_by(Year) %>% filter(Ref == max(Ref)) %>% ungroup()
自定义输出列名(可选)
如果你希望输出的列名和你最初写的MaxRefAmt一致,可以在后面加上select来重命名列:
RefTable <- returns_data %>% group_by(Year) %>% slice_max(order_by = Ref, n = 1) %>% select(Year, Month, MaxRefAmt = Ref) %>% ungroup()
用上面的方法处理你的示例数据,最终会得到这样的结果:
| Year | Month | MaxRefAmt |
|---|---|---|
| 2017 | Feb | 2345 |
| 2018 | Feb | 3453 |
内容的提问来源于stack exchange,提问作者Sven
相关产品推荐
相关产品推荐

