数据挖掘统计相异度矩阵计算中(p-m)/p公式与m值计算方法
标称属性相异度计算公式
(p-m)/p说明 公式确定逻辑
这个公式仅适用于全标称属性集的样本相异度计算场景,核心逻辑是归一化统计两个样本取值不一致的属性占总参评属性的比例:
- 分母
p是两个待比较样本的有效参评属性总数,需要排除双方均缺失的无效属性 - 分子
p-m是两个样本取值存在差异的属性总数 - 计算结果取值范围为[0,1]:结果为0代表两个样本所有属性取值完全一致,结果为1代表两个样本所有属性取值完全不同
m值的具体计算方法
m指两个样本取值完全相同的属性个数,计算流程如下:
- 第一步:先对齐两个待比较样本的属性项,排除双方均为缺失值的无效属性,统计得到有效参评属性总个数
p - 第二步:逐个遍历每个有效参评属性:如果两个样本在该属性上的非缺失取值完全一致,则
m计数+1;如果取值不同、或任意一方存在该属性的缺失值,则m不计数
计算示例
假设两个样本的有效参评属性共3项:颜色、尺寸、形状
- 样本1属性取值:红、大、圆形
- 样本2属性取值:红、小、圆形
对比可得取值相同的属性为颜色、形状,因此m=2,相异度计算为(3-2)/3≈0.33
相关参考图


内容的提问来源于stack exchange,提问作者Evan Gertis
相关产品推荐
相关产品推荐

