如何补全数据框中缺失的区间型因子变量?
补全因子型区间变量的缺失行(无需解析区间)
刚好你的bin字段是因子类型,而且所有应该存在的区间都已经作为它的levels定义好了——这正是解决问题的关键,完全不用费劲去解析那些区间字符串!下面给你两种简洁的实现方式:
方法一:用tidyverse工具(推荐,更贴合你的tibble场景)
用tidyr::complete()函数可以直接补全所有因子水平对应的行,默认会把缺失的Values设为NA,如果需要填充0也可以指定:
library(tidyverse) # 补全所有区间,缺失的Values设为NA df_complete <- df %>% complete(bin) # 如果想把缺失的Values填充为0,添加fill参数 df_complete_fill0 <- df %>% complete(bin, fill = list(Values = 0))
运行后你会看到,原来缺失的(1945,1950]和(1955,1960]都被补全了,对应的Values会是你指定的内容。
方法二:基础R实现
如果不想加载额外包,也可以用merge结合因子的levels来完成:
# 生成包含所有区间的数据集 all_bins <- data.frame(bin = levels(df$bin)) # 合并原数据,保留所有区间行 df_complete_base <- merge(all_bins, df, by = "bin", all.x = TRUE)
这个方法的原理和上面一致,都是利用因子已有的完整水平列表,把原数据中没出现的行补进来。
验证一下结果,比如查看补全后的前5行:
head(df_complete, 5)
会输出:
# A tibble: 5 × 2 bin Values <fct> <int> 1 [1940,1945] 2 2 (1945,1950] NA 3 (1950,1955] 4 4 (1955,1960] NA 5 (1960,1965] 14
完美补全了缺失的区间!
内容的提问来源于stack exchange,提问作者hmhensen
相关产品推荐
相关产品推荐

