为何使用`<-`布尔子集可自动创建不存在列?与within的差异
R数据框两种赋值方式的行为差异解析
先创建示例数据框:
(df <- data.frame(x=c(1, 2, NA, NA))) # 输出结果: # x # 1 1 # 2 2 # 3 NA # 4 NA
疑问点
为什么直接调用赋值函数给不存在的foo列的子集赋值时,能自动创建出foo列?
`<-`(df$foo[!is.na(df$x)], 999) df # 输出结果: # x foo # 1 1 999 # 2 2 999 # 3 NA NA # 4 NA NA
而使用within()函数时,必须先初始化foo列才能完成子集赋值,否则会报错:
df <- data.frame(x=c(1, 2, NA, NA)) df |> within(foo[!is.na(x)] <- 999) # 报错信息:Error: object 'foo' not found # 先初始化列则正常运行 df |> within({foo <- NA_real_; foo[!is.na(x)] <- 999}) # 输出结果: # x foo # 1 1 999 # 2 2 999 # 3 NA NA # 4 NA NA
核心原理
1. 直接df$foo[子集] <- 值的逻辑
当通过$访问数据框不存在的列并做子集赋值时,R的处理流程是:
- 首先创建一个和数据框行数一致、全为
NA的临时向量; - 对这个临时向量的指定子集(
!is.na(df$x)对应的行)赋值为999; - 最后将这个修改后的向量绑定为数据框的新列
foo。
这是数据框$赋值运算符的内置特性:自动补全缺失列的结构,再完成赋值。
2. within()函数的逻辑
within()会在一个临时环境中操作数据框的列,把每一列当作独立变量处理:
- 当执行
foo[!is.na(x)] <- 999时,函数会先在临时环境中查找foo变量,此时foo不存在,因此抛出“对象未找到”的错误; - 只有先通过
foo <- NA_real_在临时环境中创建长度匹配的向量后,才能对其子集赋值,最后within会把临时环境中的变量整合回原数据框。
内容的提问来源于stack exchange,提问作者jay.sf
相关产品推荐
相关产品推荐

