R如何用tidyverse工具替代for循环基于指定列生成概率逻辑变量
简洁实现方案
方案1:向量化操作(最高效,推荐)
不需要用到循环或purrr逐行映射,直接利用mutate+case_when+均匀分布随机数的向量化特性实现,性能远高于for循环,代码如下:
library(tidyverse) df <- df %>% mutate( # 生成符合概率要求的逻辑变量 lung_cancer = case_when( age <= 50 ~ FALSE, smoking ~ runif(n()) < 0.05, !smoking ~ runif(n()) < 0.001 ) )
实现逻辑:runif(n())会生成和数据行数一致的0-1区间均匀分布随机数,随机数小于概率阈值的概率刚好等于你需要的取值为TRUE的概率,完全匹配你要求的分布规则。
方案2:rowwise逐行处理(和原for循环逻辑完全一致)
如果你更倾向于和原循环逻辑一致的逐行采样写法,可以用dplyr的rowwise实现:
df <- df %>% rowwise() %>% mutate( lung_cancer = if_else( age > 50, sample(c(TRUE, FALSE), 1, prob = if_else(smoking, c(0.05, 0.95), c(0.001, 0.999))), FALSE ) ) %>% ungroup() # 执行完逐行操作后建议取消行分组,避免影响后续数据处理
这种写法更易读,但数据量较大时性能会低于方案1的向量化实现。
内容的提问来源于stack exchange,提问作者Papa Analytica
相关产品推荐
相关产品推荐

