语义分割分层采样:不均衡多标签掩码数据集的训验集划分
多标签分割数据集的不均衡划分方案
针对你这种含稀有类的多标签分割数据集,核心要解决的是避免稀有类在训练/验证集中分布失衡甚至缺失,具体步骤如下:
1. 分离稀有类样本并分层分配
- 先筛选出所有包含那两类稀有分割区域的图像,记为
稀有样本集;剩余图像(仅含高占比类别或无稀有类)记为普通样本集。 - 对
稀有样本集执行分层随机抽样:按照训练/验证比例(如8:2)划分,确保两类稀有类在训练集和验证集中都有样本覆盖——比如如果稀有样本里A类有10张、B类有8张,抽样时要保证训练集里A类有8张、B类有6张左右,验证集对应剩下的数量,不能只抽单一稀有类。
2. 处理普通样本的划分
对于普通样本集,可根据数据量选择两种方式:
- 若普通样本量充足:直接按同比例(如8:2)做分层随机抽样,保证两类高占比类别在训练/验证集中的图像占比、像素覆盖占比与原数据集尽可能一致。
- 若需严格对齐整体数据分布:先计算原数据集中稀有样本与普通样本的比例,再按该比例调整普通样本的划分数量,让训练集和验证集的整体样本结构和原数据集匹配。
3. 合并样本并校验划分结果
- 将划分好的稀有类训练样本与普通类训练样本合并,验证集同理。
- 必须做校验:
- 验证集中两类稀有类均有样本,且每类样本数至少能支撑稳定评估(建议每类不少于5-10张,避免评估结果波动过大)。
- 高占比类别在训练/验证集中的像素覆盖占比、出现图像占比,与原数据集的偏差控制在合理范围内(比如±5%)。
4. 可选优化策略
- 若稀有样本总量极少(比如不足50张),可调整稀有样本的划分比例为7:3(训练:验证),让验证集的稀有类占比略高,更能准确检验模型对稀有类的分割效果。
- 保留所有样本的多标签掩码信息,确保模型训练时能学习到多类别共存的场景,避免丢失关键关联特征。
内容的提问来源于stack exchange,提问作者ayabp
相关产品推荐
相关产品推荐

