目标检测器单类别最优置信度阈值确定及固定阈值性能评估
单类别最优置信度阈值确定方法
- 在模型的验证集上,生成每个类别的所有预测结果,每条结果需包含置信度分数和对应的真实标注(判断该预测是否为正样本,即检测框与真实框的IoU是否达标,通常设为0.5)。
- 对每个类别的预测结果,按置信度分数从高到低排序。
- 遍历不同的置信度阈值(比如从0到1以0.01为步长),计算每个阈值对应的精确率(Precision)和召回率(Recall),绘制该类别的PR曲线。
- 根据业务需求选择最优阈值:
- 若业务要求少误检,可在召回率满足最低要求的前提下,选取对应精确率最高的阈值;
- 若业务要求少漏检,可在精确率满足最低要求的前提下,选取对应召回率最高的阈值;
- 若需要平衡两者,直接选取F1分数(公式:
2 * (Precision * Recall) / (Precision + Recall))最高的阈值,这是最常用的平衡方案。
- 注意:必须为每个类别单独计算阈值,不同类别的样本分布、模型拟合程度差异极大,统一阈值会严重影响部分类别的性能。
固定置信度阈值下的模型性能评估
确定每个类别的固定阈值后,可在验证集或测试集上统计以下核心指标:
- 精确率(Precision):该类别中,模型正确检测的样本数占所有被预测为该类别样本数的比例,反映预测结果的准确性。
- 召回率(Recall):该类别中,模型正确检测的样本数占所有真实存在的该类别样本数的比例,反映模型的覆盖能力。
- F1分数:精确率与召回率的调和平均,综合衡量模型的平衡性能。
- 误检/漏检数:直接统计置信度达标但检测错误的样本数(误检),以及真实存在但未被检测到的样本数(漏检),适合业务场景下的直观评估。
- 平均IoU:统计所有置信度达标且检测正确的样本的IoU平均值,衡量模型检测框的定位精度。
关于AP类指标的说明
AP(平均精确率)及其变体(如mAP)是通过遍历所有置信度阈值,对精确率进行积分或求和得到的综合指标,它反映的是模型在全阈值区间的整体表现。但当我们选定固定阈值后,只需关注该阈值对应的单点性能,此时AP类指标不再适用,改用上述的单点指标即可精准评估模型在该阈值下的实际表现。
内容的提问来源于stack exchange,提问作者elena
相关产品推荐
相关产品推荐

