You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何检测以目录为标签的图像分类数据集中的误标注图像?

检测目录式图像分类数据集误标注图像的常用方法
  • 模型预测一致性校验:先训练一个基础图像分类模型,用它遍历整个数据集做预测。把模型预测类别和目录标注类别不匹配的图像拎出来重点排查,尤其是模型预测置信度很高但和标注不符的样本,基本都是误标注。
  • 聚类分析:用预训练的特征提取模型(比如ResNet、VGG)把所有图像转换成特征向量,再用K-means这类聚类算法分组。如果同一目录里的图像被分到其他聚类组,或者不同目录的图像聚在了一起,这些异常样本就是可疑的误标注。
  • 样本相似度比对:计算同一目录内图像的相似度,找出和同类别大部分样本相似度极低的图像;同时找不同目录间相似度极高的样本——跨目录高度相似的图像十有八九是归类错误。常用的指标有余弦相似度、结构相似性指数(SSIM)。
  • 人工抽样复核:按比例随机抽取不同目录的样本,或者结合前面方法筛出来的可疑样本,由人工逐个检查。这是最直接的办法,适合小数据集或者对精度要求极高的场景。
  • 主动学习式筛选:借鉴主动学习的思路,优先挑出模型最拿不准的样本(比如预测置信度接近0.5的)来人工检查。这类样本通常要么是误标注,要么是难分类的边缘样本,能高效定位问题。
  • 统计特征异常检测:统计每个目录下图像的颜色分布、纹理、尺寸等统计特征,找出偏离该目录整体特征的图像。比如“猫”的目录里突然出现一堆蓝色调为主的图,大概率是误放的“海洋”类图片。

内容的提问来源于stack exchange,提问作者Yazid Hilmi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.01 13:07:38