如何在R语言中移除tidygraph对象列表中的重复元素?
解决tidygraph列表去重并保留高频组元素的问题
我来帮你修正代码,实现你想要的效果——给每个重复的tidygraph组统一标记出现次数(frequency),然后只保留每个组的一个实例。
核心思路拆解
- 生成唯一标识:用每个tidygraph的
name列(替换NA后拼接)作为分组依据,判断哪些graph是重复的。 - 计算组出现次数:统计每个标识对应的graph数量,这就是该组的frequency值。
- 统一标记frequency:给同一个组内的所有graph的节点都添加相同的frequency值(而不是每个节点不同)。
- 去重保留实例:按分组筛选,每个组只保留一个graph实例。
修正后的完整代码
library(tidygraph) library(dplyr) library(purrr) # 你的原始数据生成代码(不变) nodes <- data.frame(name = c("x4", NA, NA), val = c(1, 5, 2)) nodes2 <- data.frame(name = c("x4", NA, NA), val = c(3, 2, 2)) nodes3 <- data.frame(name = c("x4", NA, NA), val = c(5, 6, 7)) nodes4 <- data.frame(name = c("x4", "x2", NA, NA, "x1", NA, NA), val = c(3, 2, 2, 1, 1, 2, 7)) nodes5 <- data.frame(name= c("x1", "x2", NA), val = c(7, 4, 2)) nodes6 <- data.frame(name = c("x1", "x2", NA), val = c(2, 1, 3)) edges <- data.frame(from = c(1,1), to = c(2,3)) edges1 <- data.frame(from = c(1, 2, 2, 1, 5, 5), to = c(2, 3, 4, 5, 6, 7)) tg <- tbl_graph(nodes = nodes, edges = edges) tg_1 <- tbl_graph(nodes = nodes2, edges = edges) tg_2 <- tbl_graph(nodes = nodes2, edges = edges) tg_3 <- tbl_graph(nodes = nodes4, edges = edges1) tg_4 <- tbl_graph(nodes = nodes5, edges = edges) tg_5 <- tbl_graph(nodes = nodes6, edges = edges) myList <- list(tg, tg_1, tg_2, tg_3, tg_4, tg_5) # 步骤1:为每个graph生成唯一标识 graph_ids <- map_chr(myList, function(g) { g %>% activate(nodes) %>% pull(name) %>% replace_na("..") %>% # 用统一字符串替换NA paste0(collapse = "") }) # 步骤2:计算每个标识的出现次数(即frequency) freq_table <- tibble(id = graph_ids) %>% count(id, name = "frequency") # 步骤3:给每个graph的节点添加对应的frequency值 list_with_freq <- map2(myList, graph_ids, function(g, id) { freq <- freq_table$frequency[freq_table$id == id] g %>% activate(nodes) %>% mutate(frequency = freq) # 给当前graph的所有节点设置相同的frequency }) # 步骤4:去重,每个组保留一个graph实例 final_list <- list_with_freq %>% # 按graph_id分组,取每组的第一个元素(因为同组的graph结构相同) split(graph_ids) %>% map(~ .x[[1]]) %>% # 转换回普通列表(保持顺序) unname()
验证结果
运行上述代码后,final_list就是你想要的结果:
- 第一个元素是
name为x4, NA, NA的组(出现3次,frequency=3) - 第二个元素是
name为x4, x2, NA, NA, x1, NA, NA的组(出现1次,frequency=1) - 第三个元素是
name为x1, x2, NA的组(出现2次,frequency=2)
查看其中一个元素的结构:
final_list[[1]]
输出会和你期望的一致,所有节点的frequency都是3,边数据也完整保留。
关键修正点说明
- 替换了
n():1为n():这样每个组的frequency是总出现次数,而非倒序计数 - 给每个graph的所有节点设置相同的frequency值:通过
map2匹配graph_id,从freq_table中获取对应次数后批量赋值 - 用
split+map实现去重:按唯一标识分组后,每组只保留第一个实例(同组的graph结构完全一致,选任意一个都可以)
内容的提问来源于stack exchange,提问作者Electrino
相关产品推荐
相关产品推荐

