如何在R的data.table分组求和时过滤指定ID的行?
问题解决方法
你的问题出在rows_filtered是对整个数据集的全局过滤,不是按date分组后每组内的过滤,所以sum(col2[rows_filtered])会先计算所有符合条件的col2总和,再把这个固定值重复分配给每个日期分组,分组功能自然失效。
用data.table的语法,正确做法是在分组计算时,针对每组内的数据做过滤,以下是两种常用写法:
写法一:在sum里直接用组内逻辑索引
library(data.table) # 假设do_not_include_ids是一个存储待排除id的向量,比如c("id001", "id002") output <- input[, .( col1 = sum(col1), col2 = sum(col2[!(id %in% do_not_include_ids)]) ), by = date]
这里!(id %in% do_not_include_ids)会在每个date分组内单独判断当前行的id是否需要排除,只对组内符合条件的col2值求和。
写法二:用ifelse转换值后求和
如果觉得逻辑索引的写法不够直观,也可以用ifelse把需要排除的行的col2值设为0,再对每组求和,结果完全一致:
output <- input[, .( col1 = sum(col1), col2 = sum(ifelse(id %in% do_not_include_ids, 0, col2)) ), by = date]
另外补充个data.table的常用语法细节:代码里的j=可以省略,用.()代替list()是更简洁的标准写法。
内容的提问来源于stack exchange,提问作者roulette01
相关产品推荐
相关产品推荐

