You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言dplyr实现分组内类别不一致的组占比统计

分组类别不一致占比统计方案

需求梳理

  • 数据集结构:两列数据,Group为分组列,每个分组固定对应2条记录;Category为待比对的类别列
  • 统计目标:计算组内2条记录的Category取值不相同的分组,占全部分组的百分比
  • 示例数据校验:共A-F 6个分组,其中4个分组类别不一致、2个分组类别一致,预期结果为66.67%

示例数据

Data <- structure(
  list(
    Group = c("A", "A", "B", "B", "C", "C", "D", "D", "E", "E", "F", "F"), 
    Category = c(1L, 2L, 3L, 3L, 5L, 6L, 7L, 7L, 7L, 6L, 5L, 4L)
  ), 
  class = "data.frame", 
  row.names = c(NA, -12L)
)

实现代码(dplyr语法)

你之前写的group_by(Group) %>% count(n())仅完成了分组行数统计,没有做组内类别值的比对,按如下逻辑修改即可:

library(dplyr)

diff_pct <- Data %>%
  group_by(Group) %>%
  # 标记当前分组是否存在类别差异:去重后类别数为2即代表两个值不一致
  summarise(is_category_diff = n_distinct(Category) == 2) %>%
  # 计算占比:逻辑值TRUE=1、FALSE=0,求均值即为差异分组占比
  summarise(pct = mean(is_category_diff) * 100) %>%
  pull(pct)

运行上述代码后diff_pct返回值为66.66667,和预期结果完全匹配。
如果需要格式化输出为带百分号的文本,可以追加格式化步骤:

scales::percent(diff_pct/100, accuracy = 0.01)
# 输出结果为 "66.67%"

逻辑说明

  • 用n_distinct(Category)判断组内类别差异的写法,比直接取Category[1] != Category[2]容错性更强,即使后续分组行数出现意外波动也不会抛出索引错误
  • 直接对逻辑判断结果求均值,是R里计算符合条件样本占比的常用写法,不需要额外统计总分组数做除法

内容的提问来源于stack exchange,提问作者remo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 17:21:26