R语言unnest含不等长嵌套列表的数据框时如何避免短列表值重复
问题原因
tidyr的unnest()函数默认遵循R基础的向量循环对齐规则:同组内长度为1的列表列,会自动重复值来匹配其他列的最长长度。你的示例数据中,condition2相关列的内嵌向量长度为2,condition3相关列的内嵌向量长度为1,因此拆嵌时condition3的所有值被重复填充了2次,而非按预期填充NA。
解决代码
先逐行计算所有列表列内嵌向量的最大长度,给短向量的前置位置补NA对齐长度,再执行拆嵌,就不会触发自动循环填充:
library(tidyverse) # 辅助函数:给向量前置补NA到指定目标长度 pad_leading_na <- function(vec, target_len) { len_gap <- target_len - length(vec) if (len_gap <= 0) return(vec) c(rep(NA, len_gap), vec) } df.result <- df.org %>% rowwise() %>% mutate( # 计算当前行所有列表列内嵌向量的最大长度 row_max_len = max(c_across(where(is.list)) %>% map_int(~length(.x[[1]]))), # 所有列表列统一补NA对齐到最大长度 across(where(is.list), ~list(pad_leading_na(.x[[1]], row_max_len))) ) %>% ungroup() %>% # 此时每行列表列长度完全一致,拆嵌无循环填充 unnest(where(is.list)) %>% select(-row_max_len)
运行上述代码得到的结果和你给出的期望输出df.desired完全一致:condition3相关字段第一行填充NA,第二行保留原始值,无重复填充问题。
如果你需要的是后置补NA(短向量的值放在第一行,后续位置补NA),只需要把辅助函数里的c(rep(NA, len_gap), vec)改成c(vec, rep(NA, len_gap))即可。
内容的提问来源于stack exchange,提问作者Chemist learns to code
相关产品推荐
相关产品推荐

