You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

求助:在dplyr中为受试者时间序列数据生成基于首日的day列

用dplyr给每位受试者生成基于首次响应日的Day列

嘿,这个需求其实用dplyr的分组操作就能轻松搞定!核心思路就是按受试者ID分组,然后针对每个组计算响应日期与该组首次响应日的天数差,再把差值转成从1开始的索引即可。

我给你写个完整的实现步骤,连示例数据都准备好了:

1. 先确保日期列是标准日期类型

如果你的response_date目前是字符格式,第一步要先转成日期类型,不然没法做天数计算:

library(dplyr)

# 假设你的数据框叫df,先转换日期列
df <- df %>%
  mutate(response_date = as.Date(response_date))

2. 分组计算Day列

用group_by()按受试者ID分组,然后用min(response_date)拿到每个组的首次响应日,再计算当前日期与首次日期的天数差,最后加1让第一天从1开始(而不是默认的0):

df_with_day <- df %>%
  group_by(subject_id) %>%
  mutate(day = as.integer(response_date - min(response_date)) + 1) %>%
  ungroup()  # 取消分组,恢复普通数据框格式

示例演示

我造了个小数据集帮你测试效果:

# 构造示例数据(每位受试者连续7天响应,起始日期不同)
df <- tibble(
  subject_id = rep(c(101, 102, 103), each = 7),
  response_date = c(
    seq(as.Date("2023-05-01"), by = "day", length.out = 7),
    seq(as.Date("2023-06-15"), by = "day", length.out = 7),
    seq(as.Date("2023-03-20"), by = "day", length.out = 7)
  )
)

# 运行代码后,结果会呈现:
# subject_id response_date day
#        101    2023-05-01   1
#        101    2023-05-02   2
#        ...
#        102    2023-06-15   1
#        102    2023-06-16   2
#        ...

这样每个受试者的day列都会从自己的首次响应日开始,依次递增到7,完美匹配你的需求!

内容的提问来源于stack exchange,提问作者Sydney

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 08:37:57