R语言dplyr实现分组内类别不一致的组占比统计
分组类别不一致占比统计方案
需求梳理
- 数据集结构:两列数据,
Group为分组列,每个分组固定对应2条记录;Category为待比对的类别列 - 统计目标:计算组内2条记录的
Category取值不相同的分组,占全部分组的百分比 - 示例数据校验:共A-F 6个分组,其中4个分组类别不一致、2个分组类别一致,预期结果为66.67%
示例数据
Data <- structure( list( Group = c("A", "A", "B", "B", "C", "C", "D", "D", "E", "E", "F", "F"), Category = c(1L, 2L, 3L, 3L, 5L, 6L, 7L, 7L, 7L, 6L, 5L, 4L) ), class = "data.frame", row.names = c(NA, -12L) )
实现代码(dplyr语法)
你之前写的group_by(Group) %>% count(n())仅完成了分组行数统计,没有做组内类别值的比对,按如下逻辑修改即可:
library(dplyr) diff_pct <- Data %>% group_by(Group) %>% # 标记当前分组是否存在类别差异:去重后类别数为2即代表两个值不一致 summarise(is_category_diff = n_distinct(Category) == 2) %>% # 计算占比:逻辑值TRUE=1、FALSE=0,求均值即为差异分组占比 summarise(pct = mean(is_category_diff) * 100) %>% pull(pct)
运行上述代码后diff_pct返回值为66.66667,和预期结果完全匹配。
如果需要格式化输出为带百分号的文本,可以追加格式化步骤:
scales::percent(diff_pct/100, accuracy = 0.01) # 输出结果为 "66.67%"
逻辑说明
- 用
n_distinct(Category)判断组内类别差异的写法,比直接取Category[1] != Category[2]容错性更强,即使后续分组行数出现意外波动也不会抛出索引错误 - 直接对逻辑判断结果求均值,是R里计算符合条件样本占比的常用写法,不需要额外统计总分组数做除法
内容的提问来源于stack exchange,提问作者remo
相关产品推荐
相关产品推荐

