如何为R语言数据集迭代生成带半修改名称的编码列
为数据框列生成编码列的多种R实现方法
先还原符合预期结果的原始数据集(原示例预期包含部分特殊值,先做对应调整):
BEZ <- c("A","A","A","A","B","B","B") var <- c("B","B","B","B","B","B","B") bar <- c("B","B","C","B","B","B","B") # 调整第3个值为C Bez1 <- c("A","A","A","A","B","B","B") var1 <- c("B","B","B","C","C","B","B") # 调整第4-5个值为C bar1 <- c("B","B","A","B","C","B","B") # 调整第3、5个值为A、C dat <- data.frame(BEZ, var, bar, Bez1, var1, bar1)
以下是几种不同风格的实现方式:
1. 基础for循环
直观易懂,适合新手理解底层逻辑:
for (col in names(dat)) { # 将字符转为0起始的数字编码(因子默认从1开始,故减1匹配预期) dat[[paste0(col, "_num")]] <- as.integer(factor(dat[[col]])) - 1 }
2. purrr函数式编程
用map_dfc批量处理列,生成编码列后合并到原数据:
library(purrr) # 生成所有编码列组成的数据框 num_cols <- map_dfc(dat, ~ as.integer(factor(.x)) - 1) # 给编码列添加后缀 names(num_cols) <- paste0(names(num_cols), "_num") # 合并原数据与编码列 dat <- bind_cols(dat, num_cols)
3. apply系列(sapply)
通过矩阵转数据框的方式批量生成编码列:
# 生成编码矩阵 num_matrix <- sapply(dat, function(x) as.integer(factor(x)) - 1) # 转为数据框并重命名 num_df <- as.data.frame(num_matrix) names(num_df) <- paste0(names(num_df), "_num") # 合并到原数据 dat <- cbind(dat, num_df)
4. dplyr管道式实现
最简洁的现代R编程风格,适合管道流处理:
library(dplyr) dat <- dat %>% mutate(across(everything(), ~ as.integer(factor(.x)) - 1, .names = "{col}_num"))
所有方法最终都会生成包含原列和对应_num后缀编码列的数据框,完全匹配预期结果。
内容的提问来源于stack exchange,提问作者12666727b9
相关产品推荐
相关产品推荐

