You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Stata大样本中统计ID出现频次的频次方法问询

Stata中高效统计大样本ID出现频次分布的方法

针对百万级规模的数据集,无法通过tabulate命令直接统计ID的出现频次分布时,可通过以下步骤生成你需要的「出现N次的ID数量」统计表格:

步骤1:确保ID为字符串类型(可选但重要)

如果你的ID包含前导零(如示例中的0011003),需先将数值型ID转换为字符串,避免前导零丢失:

tostring ID, replace format(%07s) // 这里的%07s表示保留7位字符,可根据实际ID长度调整

步骤2:计算每个ID的出现次数

通过分组排序生成每个ID的出现次数变量:

bysort ID: gen id_count = _N

步骤3:统计频次分布

使用collapse命令直接生成「出现次数-对应ID数量」的统计结果,这是处理大样本最高效的方式:

collapse (count) freq=ID, by(id_count)

执行完上述命令后,数据集会变成两列:

  • id_count:对应你需要表格中的Count列(即ID出现的次数)
  • freq:对应Freq列(即出现该次数的ID总数)

如果需要更直观的查看格式,可执行:

label variable id_count "Count"
label variable freq "Freq"
list, clean noobs

比如针对你的示例数据,执行后会得到:

CountFreq
11
21
31

对应到大规模数据集,就会生成你需要的百万级统计结果。

内容的提问来源于stack exchange,提问作者user8098993

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.30 15:39:21