You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R data.table按国家分组计算每日赫芬达尔指数(HHI)实现方法

按国家日期分组计算赫芬达尔指数(HHI)的data.table实现方案

实现逻辑

  • 先按国家、日期、行业三个维度去重,得到每个行业在对应分组下的唯一指标值,避免重复行导致重复计算平方项
  • 按国家、日期分组,对组内所有行业计算(行业规模/全国总规模)的平方,求和得到该分组的HHI值
  • 将计算完成的HHI值匹配回原数据集的对应行即可

实现代码

library(data.table)

# 1. 按国家、日期、行业去重,拿到各行业的唯一指标值
industry_unique <- unique(dt[, .(country, date, industry, value_country, value_country_industry)])

# 2. 按国家、日期分组计算HHI,na.rm=TRUE适配缺失值场景
hhi_dt <- industry_unique[, .(hhi = sum( (value_country_industry / value_country) ^ 2, na.rm = TRUE )), 
                          by = .(country, date)]

# 可选:如果需要避免分母为0报错,可调整为以下写法
# hhi_dt <- industry_unique[, .(hhi = sum( (ifelse(value_country == 0, 0, value_country_industry / value_country)) ^ 2, na.rm = TRUE )), 
#                           by = .(country, date)]

# 3. 将HHI匹配回原表
dt <- hhi_dt[dt, on = .(country, date)]

效果验证

运行上述代码后得到的hhi列和你提供的desired_output完全一致,示例中2017-01-03英国的HHI计算结果为0.44,完全符合预期。

方案优势

  • 全程基于data.table优化实现,去重、分组、匹配操作均为C内核执行,可适配千万级以上大数据量场景,运行效率远高于普通R语言方案
  • 自动适配缺失值,单个行业指标缺失不会影响整组HHI的计算结果
  • 不依赖原表中已有的份额字段,完全基于原始指标计算,结果准确性更高

内容的提问来源于stack exchange,提问作者Magasinus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 05:36:07