R语言多受试者数据集:分组管道式条件列生成及多最大值处理问询
多受试者换药场景下的R数据处理方案
背景
存在换药的受试者,需计算体内前药残留量以避免干扰新药实测浓度(DV)。现有针对单受试者生成条件列的R代码:
Data$TEST <- 0 Data$TEST[(Data$PROD==4 | Data$PROD==6) & Data$DV>0 & Data$TYPE==1] <- cumsum(1:length(Data$TEST[(Data$PROD==4 | Data$PROD==6) & Data$DV>0 & Data$TYPE==1]))
后续标记最大值的代码:
Data$TEST2 <- 0 Data$TEST2[Data$TEST == max(Data$TEST)] <- 1
上述代码仅支持单受试者数据集,需修改为按ID分组的多受试者版本。
问题1:整合group_by(ID)并转为管道形式
注意:原单受试者代码中的cumsum是冗余的——cumsum(1:n)会生成累加和(如1,3,6...),若目标是给符合条件的行按出现顺序标记1、2、3...,应直接使用连续序号。以下是修正后的管道化分组代码:
代码实现(基于dplyr)
library(dplyr) # 按ID分组生成TEST列 Data <- Data %>% group_by(ID) %>% mutate( # 给符合条件的行按出现顺序标记1、2、3...,其余行设为0 TEST = case_when( (PROD %in% c(4, 6)) & DV > 0 & TYPE == 1 ~ seq_along(which((PROD %in% c(4, 6)) & DV > 0 & TYPE == 1))[cumsum((PROD %in% c(4, 6)) & DV > 0 & TYPE == 1)], TRUE ~ 0L ) ) %>% ungroup() # 生成TEST2列(标记TEST最大值的行) Data <- Data %>% group_by(ID) %>% mutate( TEST2 = ifelse(TEST == max(TEST, na.rm = TRUE), 1L, 0L) ) %>% ungroup()
代码说明
group_by(ID):按受试者ID分组,确保每个受试者的计数独立计算case_when:精准匹配符合条件的行,用seq_along()生成连续序号,其余行保持0ungroup():处理完成后取消分组,避免后续操作受分组状态影响max(TEST, na.rm = TRUE):加入na.rm=TRUE避免空值干扰最大值计算
附加问题:单ID存在多个TEST最大值的处理方式
当同一受试者多次换药导致TEST列出现多个最大值时,可根据业务需求选择以下两种处理方式:
方式1:标记所有等于最大值的行
如果需要把所有达到最大计数的行都标记为1(比如所有对应最后一次换药的记录):
Data <- Data %>% group_by(ID) %>% mutate( TEST2 = ifelse(TEST == max(TEST, na.rm = TRUE), 1L, 0L) ) %>% ungroup()
方式2:仅标记最后一个最大值行
如果只需要标记最后一条达到最大计数的记录(比如最新的换药记录):
Data <- Data %>% group_by(ID) %>% mutate( max_TEST = max(TEST, na.rm = TRUE), # 定位所有等于最大值的行,仅标记最后一行 TEST2 = ifelse(TEST == max_TEST & row_number() == last(which(TEST == max_TEST)), 1L, 0L) ) %>% select(-max_TEST) %>% # 移除临时计算列 ungroup()
内容的提问来源于stack exchange,提问作者SFKR
相关产品推荐
相关产品推荐

