You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在R语言中统计ID列重复次数并生成对应列及次数列表?

R语言实现ID重复次数统计需求

首先处理原始数据,注意到最后一个ID是29000.(带小数点),先统一格式:

# 原始ID数据
id_vec <- c("39299", "30299", "39299", "39299", "38744", "38744", "27222", "39299", "29000", "38744", "29000", "29000", "29000.")

# 清理数据:去掉末尾的点,转成数值型
id_clean <- as.numeric(gsub("\\.$", "", id_vec))

# 转成数据框(方便生成新列)
df <- data.frame(ID = id_clean)

需求一:生成新列展示每个ID的重复次数

方法1:Base R原生实现

用ave()函数直接添加统计列:

df$repeat_count <- ave(df$ID, df$ID, FUN = length)

方法2:Tidyverse语法(dplyr包)

如果习惯用管道式写法:

library(dplyr)
df <- df %>%
  group_by(ID) %>%
  mutate(repeat_count = n()) %>%
  ungroup()

处理后的数据框会新增repeat_count列,每个ID行对应自身的重复次数。

需求二:获取各唯一ID的重复次数列表

方法1:按ID数值排序输出次数

用table()函数统计后转成向量:

count_vec <- as.vector(table(df$ID))
# 输出结果:c(1, 4, 1, 3, 4),对应排序后的ID:27222(1)、29000(4)、30299(1)、38744(3)、39299(4)

方法2:按ID首次出现顺序输出(匹配你的示例)

如果需要和你给出的c(4, 1, 3, 1, 4)顺序一致(对应39299、30299、38744、27222、29000的次数),先把ID转为按首次出现排序的因子:

# 按首次出现顺序设置因子水平
df$ID <- factor(df$ID, levels = unique(df$ID))
# 提取次数向量
count_vec <- as.vector(table(df$ID))
# 此时count_vec为c(4, 1, 3, 1, 4),完全匹配示例要求

方法3:Dplyr包自定义顺序提取

library(dplyr)
count_vec <- df %>%
  mutate(ID = factor(ID, levels = unique(ID))) %>%
  count(ID) %>%
  pull(n)

内容的提问来源于stack exchange,提问作者Sherry

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.22 14:24:16