部分ground-truth无对应预测关键点时如何计算NME指标?
人脸关键点检测缺测点的指标计算通用方案
你提到的将缺测点归入失败结果集统计FR(失败率)、计算NME时忽略缺测点的方案是目前学界和工业界的主流处理方式,可落地性很强,具体执行时可以参考以下规则:
1. 明确失败判定维度和阈值
根据你的使用场景选择对应的判定规则,且规则必须公开明确,保证指标可复现、可对比:
- 单图级失败判定:只要单张图内的缺测点数量超过预设阈值(常见阈值为「缺1个即判定失败」、「缺测点占比超过5%判定失败」),整张图计入失败样本,不参与NME计算,最终单独统计:
FR = 失败样本数 / 总测试样本数 - 关键点级失败判定:如果场景对漏检容忍度较高、缺测点占比极低,可以仅将缺测点排除在对应单图的NME计算外,额外补充统计关键点缺失率作为辅助指标即可。
2. 不同场景的适配建议
- 学术论文投稿场景:优先采用单图级失败判定规则,与主流公开数据集的 benchmark 规则保持一致,方便和SOTA结果直接对比,不要随意自定义规则避免指标失去可比性。
- 工业落地场景:除了NME和FR之外,建议额外统计缺测点的分布规律,比如是否集中在侧脸轮廓、遮挡区域、低分辨率人脸等特定样本上,方便针对性优化检测器的短板。
- 高安全级场景(比如人脸支付、身份核验):如果不想拆分统计FR和NME,也可以选择给缺测点赋予最大误差值计入NME,这种方式会拉低整体NME表现,但能更严苛地反映模型的真实可用性。
3. 注意避坑
不要为了得到更优的NME结果刻意放宽失败阈值,比如将大量检测效果差、缺测点多的样本都归入失败集,最终得到的NME会严重失真,完全无法反映模型的实际性能。
内容的提问来源于stack exchange,提问作者user8510613
相关产品推荐
相关产品推荐

