You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言多受试者数据集:分组管道式条件列生成及多最大值处理问询

多受试者换药场景下的R数据处理方案

背景

存在换药的受试者,需计算体内前药残留量以避免干扰新药实测浓度(DV)。现有针对单受试者生成条件列的R代码:

Data$TEST <- 0
Data$TEST[(Data$PROD==4 | Data$PROD==6) & Data$DV>0 & Data$TYPE==1] <- cumsum(1:length(Data$TEST[(Data$PROD==4 | Data$PROD==6) & Data$DV>0 & Data$TYPE==1]))

后续标记最大值的代码:

Data$TEST2 <- 0
Data$TEST2[Data$TEST == max(Data$TEST)] <- 1

上述代码仅支持单受试者数据集,需修改为按ID分组的多受试者版本。


问题1:整合group_by(ID)并转为管道形式

注意:原单受试者代码中的cumsum是冗余的——cumsum(1:n)会生成累加和(如1,3,6...),若目标是给符合条件的行按出现顺序标记1、2、3...,应直接使用连续序号。以下是修正后的管道化分组代码:

代码实现(基于dplyr)

library(dplyr)

# 按ID分组生成TEST列
Data <- Data %>%
  group_by(ID) %>%
  mutate(
    # 给符合条件的行按出现顺序标记1、2、3...,其余行设为0
    TEST = case_when(
      (PROD %in% c(4, 6)) & DV > 0 & TYPE == 1 ~ seq_along(which((PROD %in% c(4, 6)) & DV > 0 & TYPE == 1))[cumsum((PROD %in% c(4, 6)) & DV > 0 & TYPE == 1)],
      TRUE ~ 0L
    )
  ) %>%
  ungroup()

# 生成TEST2列(标记TEST最大值的行)
Data <- Data %>%
  group_by(ID) %>%
  mutate(
    TEST2 = ifelse(TEST == max(TEST, na.rm = TRUE), 1L, 0L)
  ) %>%
  ungroup()

代码说明

  • group_by(ID):按受试者ID分组,确保每个受试者的计数独立计算
  • case_when:精准匹配符合条件的行,用seq_along()生成连续序号,其余行保持0
  • ungroup():处理完成后取消分组,避免后续操作受分组状态影响
  • max(TEST, na.rm = TRUE):加入na.rm=TRUE避免空值干扰最大值计算

附加问题:单ID存在多个TEST最大值的处理方式

当同一受试者多次换药导致TEST列出现多个最大值时,可根据业务需求选择以下两种处理方式:

方式1:标记所有等于最大值的行

如果需要把所有达到最大计数的行都标记为1(比如所有对应最后一次换药的记录):

Data <- Data %>%
  group_by(ID) %>%
  mutate(
    TEST2 = ifelse(TEST == max(TEST, na.rm = TRUE), 1L, 0L)
  ) %>%
  ungroup()

方式2:仅标记最后一个最大值行

如果只需要标记最后一条达到最大计数的记录(比如最新的换药记录):

Data <- Data %>%
  group_by(ID) %>%
  mutate(
    max_TEST = max(TEST, na.rm = TRUE),
    # 定位所有等于最大值的行,仅标记最后一行
    TEST2 = ifelse(TEST == max_TEST & row_number() == last(which(TEST == max_TEST)), 1L, 0L)
  ) %>%
  select(-max_TEST) %>% # 移除临时计算列
  ungroup()

内容的提问来源于stack exchange,提问作者SFKR

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 23:27:27