如何在data.table中链式实现group_by、filter、distinct、count操作
问题原因分析
你编写的data.table代码不符合基础语法规则:data.table的核心语法结构为DT[i, j, by],过滤行的条件需要放在第一个参数i的位置,你把过滤非空日期的条件放在i位后错误添加了by=id参数,第一步逻辑就已经出错。后续的keyby=.(date)也没有实现「按id分组后去重日期」的逻辑,最终导致结果不符合预期。
正确实现代码
逐步骤对应dplyr逻辑的写法
你可以参考下面的代码和注释,和你原有的dplyr逻辑一一对应,方便理解:
test_dt <- as.data.table(test_df) # 推荐用as.data.table,避免修改原数据框 test_dt[!is.na(date), # 对应filter(!is.na(date))过滤非空日期 .(date = unique(date)), # 对应distinct(date)取分组内唯一日期 by = id][ # 对应group_by(id)按id分组 , .(n = .N), # 对应count(id)统计每个id的唯一日期数量 by = id][ n > 1 # 对应filter(n>1)筛选符合条件的id ]
简洁高效写法
你也可以用data.table内置的uniqueN()函数直接实现需求,运行效率更高:
test_dt[!is.na(date), .(n = uniqueN(date)), by = id][n > 1]
uniqueN()可以直接统计分组内唯一值的数量,完全匹配你需要的「统计每个id不同日期数量」的逻辑。
运行结果
和你原dplyr代码的输出完全一致:
id n 1: 5678 2
内容的提问来源于stack exchange,提问作者ViSa
相关产品推荐
相关产品推荐

