R运行data.table时出现index 'SiteName' exists but is invalid报错如何解决
报错原因
该报错是data.table与dplyr函数混用导致的索引失效问题:
- 你的
all.new是data.table类型对象,且提前为SiteName列创建了原生索引 - 你在循环中使用dplyr的
anti_join函数修改all.new时,dplyr不会同步维护data.table的原生索引,导致索引的标记还存在,但实际内容已经和修改后的数据集不匹配 - 后续你再次用
all.new[SiteName == sitename]筛选数据时,data.table尝试调用已经失效的SiteName索引,触发了这个内部错误
解决方法
你可以选择以下任意一种方案解决:
- 方案一:每次修改
all.new后主动清理失效索引,在all.new <- anti_join(all.new, df2)代码后新增一行setindex(all.new, NULL)清除所有旧索引,若需要保留索引优化查询速度,也可以直接重建SiteName索引:setindex(all.new, SiteName) - 方案二:避免data.table与dplyr语法混用,将删除操作替换为data.table原生写法,把
all.new <- anti_join(all.new, df2)修改为all.new <- all.new[!df2, on = names(all.new)],原生操作会自动维护索引,不会出现失效问题 - 方案三:如果你对data.table语法不熟悉,直接在循环开始前将数据集转为普通data.frame即可,新增代码:
all.new <- as.data.frame(all.new),操作完成后如果有需要再转回data.table类型 - 额外优化:建议将你当前的赋值语句
all.newpoint[which(all.newdata$Lat %in% unique(df2$Lat) & all.newdata$Lon %in% unique(df2$Lon))]$PointID <- point.id替换为data.table原生赋值写法:all.newpoint[Lat %in% unique(df2$Lat) & Lon %in% unique(df2$Lon), PointID := point.id],避免链式赋值出现的赋值失效问题
内容的提问来源于stack exchange,提问作者Heeone Lee
相关产品推荐
相关产品推荐

