You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言如何在长格式数据中按id分组匹配每行的下一次行动日期

实现方案

针对你的超大规模数据集需求,以下两种方案均不需要做长表/宽表互转,仅通过分组向量偏移实现,内存占用低、执行效率高:

方案1:data.table实现(优先推荐,适配千万级以上数据集)

data.table采用引用修改机制,不需要全量复制数据,处理8500万行数据的内存开销和速度表现远优于其他方案:

library(data.table)
# 将数据框转换为data.table格式,无全量拷贝开销
setDT(df)

# 可选步骤:如果你的数据没有提前按id、move升序排序,先执行排序保证次序正确
setorder(df, id, move)

# 按id分组,取date列的下一个偏移值,分组最后一行自动返回NA,完全匹配你的需求
df[, `next` := shift(date, type = "lead"), by = id]

注意:next是R的保留关键字,直接用作列名需要加反引号包裹,建议替换为next_date之类的自定义名称避免语法冲突。

方案2:tidyverse(dplyr)实现

如果你更习惯tidyverse语法,也可以用dplyr的lead函数实现:

library(dplyr)
df <- df %>%
  group_by(id) %>%
  # 按组内move排序,保证次序正确
  arrange(move, .by_group = TRUE) %>%
  # 取同组下一行的date值
  mutate(`next` = lead(date)) %>%
  ungroup()

两种方案的输出结果和你给出的期望结果完全一致,不需要额外的表关联或格式转换操作。

内容的提问来源于stack exchange,提问作者tchoup

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 21:24:03