You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

部分ground-truth无对应预测关键点时如何计算NME指标?

人脸关键点检测缺测点的指标计算通用方案

你提到的将缺测点归入失败结果集统计FR(失败率)、计算NME时忽略缺测点的方案是目前学界和工业界的主流处理方式,可落地性很强,具体执行时可以参考以下规则:

1. 明确失败判定维度和阈值

根据你的使用场景选择对应的判定规则,且规则必须公开明确,保证指标可复现、可对比:

  • 单图级失败判定:只要单张图内的缺测点数量超过预设阈值(常见阈值为「缺1个即判定失败」、「缺测点占比超过5%判定失败」),整张图计入失败样本,不参与NME计算,最终单独统计:
    FR = 失败样本数 / 总测试样本数
  • 关键点级失败判定:如果场景对漏检容忍度较高、缺测点占比极低,可以仅将缺测点排除在对应单图的NME计算外,额外补充统计关键点缺失率作为辅助指标即可。

2. 不同场景的适配建议

  • 学术论文投稿场景:优先采用单图级失败判定规则,与主流公开数据集的 benchmark 规则保持一致,方便和SOTA结果直接对比,不要随意自定义规则避免指标失去可比性。
  • 工业落地场景:除了NME和FR之外,建议额外统计缺测点的分布规律,比如是否集中在侧脸轮廓、遮挡区域、低分辨率人脸等特定样本上,方便针对性优化检测器的短板。
  • 高安全级场景(比如人脸支付、身份核验):如果不想拆分统计FR和NME,也可以选择给缺测点赋予最大误差值计入NME,这种方式会拉低整体NME表现,但能更严苛地反映模型的真实可用性。

3. 注意避坑

不要为了得到更优的NME结果刻意放宽失败阈值,比如将大量检测效果差、缺测点多的样本都归入失败集,最终得到的NME会严重失真,完全无法反映模型的实际性能。

内容的提问来源于stack exchange,提问作者user8510613

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 11:24:02