如何将multinomial logistics预测概率转换为连续变量期望值?
问题解答
可行性结论
可以转换,你提到的二项分布np期望计算逻辑完全可以复用在该场景下,本质都是计算随机变量在对应概率分布下的加权期望。
具体计算公式(以你的0-2得分场景为例)
第一步:确定每个分类的代表值
你将原始0-2的得分划分为3个区间,需要先为每个区间确定对应代表值,有两种常用方案:
- 区间中点法:直接取每个区间的中位数作为代表值,对应你的区间划分结果为:
- 0-0.6区间:代表值
0.3 - 0.6-1区间:代表值
0.8 1区间(1-2):代表值
1.5
- 0-0.6区间:代表值
- 类别均值法:用训练集中每个类别下所有样本的原始得分平均值作为代表值,该方案更贴合你的真实数据分布,准确性更高。
第二步:加权求和计算连续估计值
假设多分类逻辑回归输出的3个类别对应预测概率分别为p₁(0-0.6区间概率)、p₂(0.6-1区间概率)、p₃(>1区间概率),最终的原始得分估计值为:
estimated_score = p₁ * v₁ + p₂ * v₂ + p₃ * v₃
其中v₁/v₂/v₃分别为三个类别的代表值。
注意事项
- 转换后的估计值精度和分类粒度正相关,划分的类别越多,估计值越接近原始真实得分
- 如果原始连续变量在某个区间内分布明显不均,优先选择类别均值法确定代表值,避免区间中点法带来的系统性偏差
内容的提问来源于stack exchange,提问作者Nawal Kashyap
相关产品推荐
相关产品推荐

