R语言遍历数据框列查找重复值并为重复项追加递增序号
问题报错根源
你写的for循环存在3个核心问题,直接导致报错和逻辑错误:
lag()是面向向量的滞后计算函数,你在循环中传入单个标量值df[i,1]做滞后计算,返回结果为NA。if条件判断无法处理NA逻辑值,就会抛出你看到的missing value where TRUE/FALSE needed报错。- 每次循环开头都重置
count <- 0,计数器根本无法实现跨循环累计,即使判断逻辑正确也得不到正确的递增序号。 - 赋值语句
df$Promoter <- paste(df[i,1], count, sep=".")会把整个Promoter列替换为当前行的计算结果,而非仅修改当前行的值,逻辑完全错误。
另外逐行for循环处理78000行数据的运行效率很低,完全没必要用循环实现。
推荐实现方案(dplyr向量化计算,适配大数据量)
用dplyr的分组计算逻辑可以快速实现需求,按名称分组后给组内行按顺序编号,仅对出现次数≥2的名称拼接后缀即可,运行速度远高于循环:
library(dplyr) df <- df %>% group_by(Promoter) %>% mutate( occur_total = n(), row_seq = row_number(), Promoter = ifelse( occur_total == 1, as.character(Promoter), paste0(Promoter, "_", row_seq) ) ) %>% ungroup() %>% select(-occur_total, -row_seq)
可选Base R实现(无需安装第三方包)
如果不想加载dplyr,也可以用基础R的ave函数实现同样的分组计算逻辑:
# 计算每个名称的组内顺序号 row_seq <- as.numeric(ave(as.character(df$Promoter), df$Promoter, FUN = seq_along)) # 计算每个名称的总出现次数 occur_total <- as.numeric(ave(as.character(df$Promoter), df$Promoter, FUN = length)) # 按规则生成新列 df$Promoter <- ifelse( occur_total == 1, as.character(df$Promoter), paste0(df$Promoter, "_", row_seq) )
结果验证
运行上述任意一段代码后,得到的Promoter列取值如下,和你预期的结果完全一致:
[1] "Xkr4_promoter" "Gm18956_promoter" "Gm19938_promoter" [4] "Gm37381_promoter_1" "Gm37381_promoter_2" "Rp1_promoter_1" [7] "Rp1_promoter_2" "Gm6101_promoter" "Gm37483_promoter" [10] "Sox17_promoter_1" "Sox17_promoter_2" "Sox17_promoter_3" [13] "Sox17_promoter_4"
内容的提问来源于stack exchange,提问作者ispeakcat
相关产品推荐
相关产品推荐

