You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何判断tibble中当前行的name值是否存在于同列其他行中

问题分析与解决

原代码出错的核心原因是:你先通过mutate(row = row_number())创建了row列,随后用row != row_number()筛选其他行,但row本身就是当前行的行号,所以row != row_number()的结果全为FALSE,导致name[row != row_number()]是空向量,自然所有name %in% 空向量的结果都是FALSE。

下面是几种正确的实现方式:

方法一:双向重复值标记(最简洁)

利用duplicated()函数,分别从前往后和从后往前标记重复值,再取逻辑或,就能把所有重复出现的行都标记为TRUE:

tibble(name = c("tommy", "tommy", "bobby")) %>%
  mutate(match = duplicated(name) | duplicated(name, fromLast = TRUE))

方法二:分组判断组规模

按name分组后,判断该组的行数是否大于1——如果是,说明这个name存在重复,组内所有行的match都为TRUE:

tibble(name = c("tommy", "tommy", "bobby")) %>%
  group_by(name) %>%
  mutate(match = n() > 1) %>%
  ungroup()

方法三:逐行检查(适合理解逻辑,效率较低)

如果一定要保留row列并逐行验证,可以用sapply遍历每个行号,检查当前行的name是否存在于排除自身后的列中:

tibble(name = c("tommy", "tommy", "bobby")) %>%
  mutate(row = row_number()) %>%
  mutate(match = sapply(row, function(x) name[x] %in% name[-x]))

以上三种方法都能得到你期望的结果:

# A tibble: 3 × 3
  name    row match
  <chr> <int> <lgl>
1 tommy     1 TRUE 
2 tommy     2 TRUE 
3 bobby     3 FALSE

内容的提问来源于stack exchange,提问作者sparklink

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.14 14:36:28