如何计算含重复ID数据集的每行占比,prop.table返回全1如何处理
错误原因
你现有代码得到全1的返回值有两个核心问题:
- 一维频次表调用
prop.table()时不需要指定margin = 1参数:margin=1是按行维度做归一计算,一维表中每个Id的频次独占一行,计算时会用频次除以自身,自然返回全1的结果 - 不要将数据集命名为
rep:rep是R内置的重复函数,重名会导致不可预期的调用异常,建议修改为df、raw_data等无冲突的变量名
解决方法
场景1:需要输出每个Id对应占比的汇总结果
直接去掉margin参数即可:
# 输出为每个Id对应占比的命名向量 id_pct <- prop.table(table(df$Id)) * 100
场景2:需要给原数据集每行新增对应Id的占比列
用dplyr的分组统计实现更方便:
library(dplyr) df <- df %>% # 按Id分组 group_by(Id) %>% # 统计当前组行数/总行数得到占比 mutate(id_pct = n() / nrow(.) * 100) %>% ungroup()
内容的提问来源于stack exchange,提问作者user17122732
相关产品推荐
相关产品推荐

