如何解决按PurchaseID计算首次与末次时间差时的报错问题
解决
data.table调用时by参数报错的问题 嘿,我看你遇到的这个报错其实是个常见的小坑——你以为已经把数据集转成data.table了,但实际上转换操作没生效,导致后续代码还是在用普通data.frame的索引语法,而data.frame的[函数根本不支持by参数,所以才会弹出unused argument (by = PurchaseID)这个错误。
为啥会出这个错?
你写了CJ <- data.table(CJ),但这里可能有两个关键问题:
- 从你贴的
dput结果来看,你的实际数据集是CJgroup,不是CJ——是不是变量名写错了? - 就算是操作
CJ,如果转换后没有正确覆盖原对象(比如原对象有特殊属性,或者你在转换后又做了其他把它变回data.frame的操作),那它还是个普通数据框,自然用不了data.table的by分组语法。
怎么解决?
方法1:老老实实把数据集转成data.table
先确认包加载了,再正确转换并分组计算:
# 先加载data.table包(没装的话先跑install.packages("data.table")) library(data.table) # 把你的实际数据集CJgroup转成data.table CJgroup <- as.data.table(CJgroup) # 按PurchaseID分组,计算首次和末次timestamp的差值 CJgroup[, difference := max(timestamp) - min(timestamp), by = PurchaseID] # 看看结果对不对 head(CJgroup)
方法2:换用dplyr来实现(如果更习惯这个语法)
要是你对data.table的语法不太熟,用dplyr的分组 mutate 也能达到同样效果:
library(dplyr) CJgroup <- CJgroup %>% group_by(PurchaseID) %>% mutate(difference = max(timestamp) - min(timestamp)) %>% ungroup()
先确认数据集类型!
你可以先跑这个命令,看看你的数据集到底是什么类型:
class(CJgroup)
如果输出是[1] "data.table" "data.frame",说明转换成功了;如果只是[1] "data.frame",那就得重新执行转换命令。
另外你说子集上执行没问题,大概率是子集操作的时候无意中触发了data.table的转换,或者子集的变量名是对的,但全量数据集的变量名写错了,这个要多留意~
内容的提问来源于stack exchange,提问作者Marc van Eck
相关产品推荐
相关产品推荐

