计算分类数据的代表性/平均组别方法咨询
找到双指标平均水平Rating组的方法
1. 先算全局基准值
- 把18个Rating组的Frequency加总,除以18得到平均Frequency(记为
avg_freq) - 把所有组的Total Value加总,除以18得到平均Total Value(记为
avg_tv)
2. 标准化指标(必做,除非两个指标量级完全一致)
因为Frequency和Total Value的数值范围可能差很多(比如Frequency是几百,Total Value是几十万),直接比和均值的差距会偏向数值大的指标。所以先做z-score标准化:
对每个Rating组:
z_freq = (当前组Frequency - avg_freq) / 所有组Frequency的标准差 z_tv = (当前组Total Value - avg_tv) / 所有组Total Value的标准差
3. 计算综合距离筛选目标组
对每个组,计算两个z值的欧氏距离:
distance = sqrt(z_freq² + z_tv²)
距离最小的那个组别,就是同时在Frequency和Total Value上最接近平均水平的组。
简化版(仅适合指标量级相近的场景)
如果Frequency和Total Value的数值量级差不多,也可以跳过标准化,直接计算每个组和(avg_freq, avg_tv)这个点的欧氏距离,选距离最小的组就行。
关于你遇到的加权平均问题
你之前卡壳的权重问题,核心是没有明确两个指标的业务优先级。如果没有特殊业务要求,默认给两个指标同等权重就合理,用上面的标准化等权距离方法,不需要额外纠结权重分配——这是这类双指标匹配问题的通用解法。
内容的提问来源于stack exchange,提问作者T BBB
相关产品推荐
相关产品推荐

