You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何计算含重复ID数据集的每行占比,prop.table返回全1如何处理

错误原因

你现有代码得到全1的返回值有两个核心问题:

  • 一维频次表调用prop.table()时不需要指定margin = 1参数:margin=1是按行维度做归一计算,一维表中每个Id的频次独占一行,计算时会用频次除以自身,自然返回全1的结果
  • 不要将数据集命名为rep:rep是R内置的重复函数,重名会导致不可预期的调用异常,建议修改为df、raw_data等无冲突的变量名

解决方法

场景1:需要输出每个Id对应占比的汇总结果

直接去掉margin参数即可:

# 输出为每个Id对应占比的命名向量
id_pct <- prop.table(table(df$Id)) * 100

场景2:需要给原数据集每行新增对应Id的占比列

用dplyr的分组统计实现更方便:

library(dplyr)
df <- df %>%
  # 按Id分组
  group_by(Id) %>%
  # 统计当前组行数/总行数得到占比
  mutate(id_pct = n() / nrow(.) * 100) %>%
  ungroup()

内容的提问来源于stack exchange,提问作者user17122732

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 23:57:03