R语言如何为data.table列表列补全子列表缺失的指定值
问题描述
需要为strata列表列的每一个向量补全缺失的边界值0和1000000,其中0补在向量头部,1000000补在向量尾部。
初始测试数据:
dat <- structure(list(cat = structure(c(1L, 3L, 2L), levels = c("A", "B", "C"), class = "factor"), strata = list(c(25, 100, 250, 500), c(25, 100, 250, 500), c(25, 100, 1000000 ))), row.names = c(NA, -3L), class = c("data.table", "data.frame" ))
初始数据预览:
cat strata 1: A 25,100,250,500 2: C 25,100,250,500 3: B 25, 100,1000000
原有错误实现代码:
dat$strata <- lapply(dat$strata, \(x){ if (0 %nin% dat$strata) { dat$strata<- append(0, dat$strata) } if (1000000 %nin% dat$strata) { dat$strata<- append(dat$strata, 1000000) } })
预期输出结果:
cat strata 1: A 0, 25,100,250,500,1000000 2: C 0, 25,100,250,500,1000000 3: B 0, 25, 100,1000000
错误原因
原有代码存在三个核心问题:
lapply遍历strata列时,每次传入的参数x是当前行的数值向量,但代码里判断、修改的对象是整列dat$strata,操作对象完全错误- 匿名函数没有返回修改后的向量,默认返回
NULL,运行后会把原有strata列的所有值覆盖为空 %nin%是data.table包提供的特殊操作符,如果未提前加载包会直接触发“找不到函数”的报错
正确实现方案
通用lapply写法
直接对每次遍历到的单条向量x做判断、补全,最后返回修改后的x即可:
# 若未加载data.table,把判断逻辑替换为 !0 %in% x、!1000000 %in% x 即可 dat$strata <- lapply(dat$strata, \(x) { if (!0 %in% x) x <- c(0, x) if (!1000000 %in% x) x <- c(x, 1000000) x })
data.table原生高效写法
适配data.table的按列修改语法,运行效率更高:
library(data.table) dat[, strata := lapply(strata, \(x) { x <- if (!0 %in% x) c(0, x) else x x <- if (!1000000 %in% x) c(x, 1000000) else x x })]
运行后打印dat即可得到和预期完全一致的结果。
内容的提问来源于stack exchange,提问作者Tom
相关产品推荐
相关产品推荐

