咨询Hierarchical Clustering的距离度量方法及Region Proposal场景常用方法
层次聚类中的距离度量及在Region Proposal任务中的应用
一、层次聚类常用的距离度量方法
- 欧氏距离(Euclidean Distance):计算欧氏空间中两点的直线距离,是最通用的连续数值型数据度量方式。
- 曼哈顿距离(Manhattan Distance):统计各维度数值差的绝对值之和,对异常值的鲁棒性优于欧氏距离,适合高维或离散数据场景。
- 余弦距离(Cosine Distance):衡量两个向量的夹角相似度,聚焦特征方向而非数值大小,常用于文本、图像等高维特征的相似度计算。
- 闵可夫斯基距离(Minkowski Distance):欧氏与曼哈顿距离的广义形式,通过参数
p控制——p=2时为欧氏距离,p=1时为曼哈顿距离。 - 切比雪夫距离(Chebyshev Distance):取各维度数值差的最大值,适用于需要关注最大差异维度的场景。
- 汉明距离(Hamming Distance):统计等长离散向量(或字符串)中对应位置不同元素的数量,专为离散分类特征设计。
二、是否根据应用目的选择不同的度量方法?
是的,距离度量的选择完全由数据类型和业务目标决定:
- 处理连续数值型数据(如用户行为特征、传感器监测数据)时,优先考虑欧氏或曼哈顿距离;
- 若关注特征的方向相似度(如文本TF-IDF向量、图像特征嵌入),余弦距离是更合适的选择;
- 针对离散分类编码数据(如类别标签的one-hot向量),汉明距离能精准衡量差异;
- 当需要弱化异常值的干扰时,曼哈顿距离比欧氏距离更具鲁棒性。
三、层次聚类用于Region Proposal任务时的常用度量方法
在Region Proposal任务中,**交并比(IoU, Intersection over Union)**是最常用的距离(相似度)度量方式。因为该任务核心是评估候选区域与真实目标的重叠程度,IoU直接计算两个边界框的重叠面积占总面积的比例,能精准反映区域的匹配度。此外,GIoU、DIoU等IoU变体也会被使用,但基础IoU仍是主流选择。
内容的提问来源于stack exchange,提问作者rem_maji_tenshi_
相关产品推荐
相关产品推荐

