You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

目标检测器单类别最优置信度阈值确定及固定阈值性能评估

单类别最优置信度阈值确定方法
  • 在模型的验证集上,生成每个类别的所有预测结果,每条结果需包含置信度分数和对应的真实标注(判断该预测是否为正样本,即检测框与真实框的IoU是否达标,通常设为0.5)。
  • 对每个类别的预测结果,按置信度分数从高到低排序。
  • 遍历不同的置信度阈值(比如从0到1以0.01为步长),计算每个阈值对应的精确率(Precision)和召回率(Recall),绘制该类别的PR曲线。
  • 根据业务需求选择最优阈值:
    • 若业务要求少误检,可在召回率满足最低要求的前提下,选取对应精确率最高的阈值;
    • 若业务要求少漏检,可在精确率满足最低要求的前提下,选取对应召回率最高的阈值;
    • 若需要平衡两者,直接选取F1分数(公式:2 * (Precision * Recall) / (Precision + Recall))最高的阈值,这是最常用的平衡方案。
  • 注意:必须为每个类别单独计算阈值,不同类别的样本分布、模型拟合程度差异极大,统一阈值会严重影响部分类别的性能。
固定置信度阈值下的模型性能评估

确定每个类别的固定阈值后,可在验证集或测试集上统计以下核心指标:

  • 精确率(Precision):该类别中,模型正确检测的样本数占所有被预测为该类别样本数的比例,反映预测结果的准确性。
  • 召回率(Recall):该类别中,模型正确检测的样本数占所有真实存在的该类别样本数的比例,反映模型的覆盖能力。
  • F1分数:精确率与召回率的调和平均,综合衡量模型的平衡性能。
  • 误检/漏检数:直接统计置信度达标但检测错误的样本数(误检),以及真实存在但未被检测到的样本数(漏检),适合业务场景下的直观评估。
  • 平均IoU:统计所有置信度达标且检测正确的样本的IoU平均值,衡量模型检测框的定位精度。
关于AP类指标的说明

AP(平均精确率)及其变体(如mAP)是通过遍历所有置信度阈值,对精确率进行积分或求和得到的综合指标,它反映的是模型在全阈值区间的整体表现。但当我们选定固定阈值后,只需关注该阈值对应的单点性能,此时AP类指标不再适用,改用上述的单点指标即可精准评估模型在该阈值下的实际表现。

内容的提问来源于stack exchange,提问作者elena

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 11:05:08