生产环境下object detection模型的监控及重训相关指标有哪些?
目标检测模型生产监控问题解答
1. 生产环境目标检测模型的通用监控逻辑
目标检测模型的监控需要覆盖输入层、模型层、服务层、业务层四个维度,不用盲目套用通用方案,优先匹配自身业务的容错标准即可:比如安防场景的漏检容错率极低,监控权重就要向漏检相关指标倾斜;电商商品识别场景对误检容忍度低,就优先监控误检相关指标。
2. PyTorch Faster RCNN部署的监控指标与重训触发条件
核心监控指标
- 服务层指标
这类是推理服务通用指标,重点监控推理耗时P95/P99、GPU显存占用率、请求成功率、请求队列积压时长。Faster RCNN属于两阶段检测模型,推理耗时波动比YOLO这类单阶段模型大,建议单独设置阈值,比如P99耗时超过基准值的20%立即告警,排查是否出现输入分辨率突变、服务资源不足的问题。 - 输入数据指标
像素级:输入图像的分辨率分布、亮度/对比度/饱和度分布、通道数占比,和训练集基准做对比。
语义级:推理输出的目标类别分布、目标框尺寸/宽高比分布,和训练集基准做对比。 - 模型效果指标
无标注场景:统计推理置信度分布、Faster RCNN专属的RPN阶段候选框objectness得分分布、重复检测率。比如基准状态下80%的检测框置信度都在0.7以上,若连续12小时占比低于50%,基本可以判定模型效果出现下滑。
有标注抽样场景:定期抽生产数据标注后计算mAP、指定IOU阈值下的Recall/Precision、分类别AP,重点关注业务核心类别的指标变化。
重训触发条件
满足任意一条即可触发重训校验:
- 核心业务指标下滑超过阈值:比如漏检率/误检率超过业务允许的上限,连续24小时没有回落
- 数据漂移超过阈值:输入图像特征和训练集特征的平均相似度连续24小时低于0.7,或者类别分布JS散度超过0.3
- 模型效果指标下滑:抽样标注得到的核心类别AP相比上线基准值下降超过10%
- 新增未覆盖场景:业务侧新增了训练集没有覆盖的场景(比如原训练集都是白天数据,现在需要覆盖夜间红外拍摄场景)
3. 目标检测模型漂移监控的落地方案
和回归模型相比,目标检测的输出包含类别、置信度、框坐标多个维度,不能直接套用回归模型单变量统计检验的方案,需要分维度处理:
数据漂移监控
- 像素级漂移:用KS检验对比生产输入和训练集的亮度、对比度分布,用Faster RCNN backbone输出的全局特征计算余弦相似度,连续1小时平均相似度低于0.7触发告警。
- 语义级漂移:用卡方检验对比生产推理的类别分布和训练集基准分布,用KS检验对比目标框尺寸、宽高比的分布,p值连续小于0.01触发告警。
模型漂移监控
- 无标注场景:对比当前推理的置信度分布、同场景历史推理结果的IOU分布,用KS检验判断分布差异,差异过大触发告警。
- 有标注校验:每周抽取1%~2%的生产数据做人工标注,计算mAP和分类别AP,相比上线基准下降超过10%触发重训。
- 业务反馈联动:将下游人工审核的漏检、误检反馈同步到监控平台,同一类别单周报错超过20次直接触发模型效果核验。
内容的提问来源于stack exchange,提问作者iamexperimenting
相关产品推荐
相关产品推荐

