人物方向分类数据集:不确定标签图像的处理方案咨询
处理带有模糊标注样本的人物方向分类数据集方案
不用直接剔除这些难以确定标签的样本,这类边界样本反而能帮助模型学习类别间的区分特征,提升泛化精度。以下是几种实用的处理方法:
软标签(模糊标签)训练
对无法明确归属的样本,分配概率化的软标签:比如分不清back和right的样本,就给right和back各分配0.5的权重,其余标签权重为0;分不清left和fore的样本同理。训练时用交叉熵损失直接计算软标签的损失,让模型学习到样本的模糊性,避免硬标签带来的噪声干扰,同时保留边界样本的信息。半监督学习利用无/弱标签样本
将明确标注的样本作为有标签数据集,不确定的样本作为无标签数据集,采用半监督算法训练:- 伪标签(Pseudo Label):先用有标签样本训练基准模型,再用模型给无标签样本预测标签,筛选出置信度高于阈值(比如0.9)的伪标签样本,和有标签样本一起迭代训练;
- 一致性正则化(如Mean Teacher模型):训练两个模型(教师/学生),对无标签样本做轻微数据增强后,要求两个模型的预测结果一致,强迫模型学习到更鲁棒的特征,减少模糊样本的干扰。
主动学习补充标注
如果有额外的标注资源,可优先对这些不确定样本重新标注:利用模型的预测置信度(比如预测概率最高的两个类别差值极小的样本)筛选出最模糊的样本,集中人力标注,用最低的成本提升数据集的标注质量。针对性数据增强辅助
对模糊样本做针对性的角度变换、裁剪等数据增强,生成更多类似的边界样本,让模型接触到更多类别交界的情况,帮助模型学习区分细微的方向差异,结合上述方法一起训练效果更好。
当然,如果模糊样本的占比极高(超过总样本的30%),且标注成本极低,或者你使用的是简单的线性分类器,直接剔除这类样本可以快速避免噪声干扰,减少训练复杂度。但大多数场景下,利用这些边界样本能让模型的分类精度和泛化能力更优。
内容的提问来源于stack exchange,提问作者Alican Kartal
相关产品推荐
相关产品推荐

