You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

语义分割分层采样:不均衡多标签掩码数据集的训验集划分

多标签分割数据集的不均衡划分方案

针对你这种含稀有类的多标签分割数据集,核心要解决的是避免稀有类在训练/验证集中分布失衡甚至缺失,具体步骤如下:

1. 分离稀有类样本并分层分配

  • 先筛选出所有包含那两类稀有分割区域的图像,记为稀有样本集;剩余图像(仅含高占比类别或无稀有类)记为普通样本集。
  • 对稀有样本集执行分层随机抽样:按照训练/验证比例(如8:2)划分,确保两类稀有类在训练集和验证集中都有样本覆盖——比如如果稀有样本里A类有10张、B类有8张,抽样时要保证训练集里A类有8张、B类有6张左右,验证集对应剩下的数量,不能只抽单一稀有类。

2. 处理普通样本的划分

对于普通样本集,可根据数据量选择两种方式:

  • 若普通样本量充足:直接按同比例(如8:2)做分层随机抽样,保证两类高占比类别在训练/验证集中的图像占比、像素覆盖占比与原数据集尽可能一致。
  • 若需严格对齐整体数据分布:先计算原数据集中稀有样本与普通样本的比例,再按该比例调整普通样本的划分数量,让训练集和验证集的整体样本结构和原数据集匹配。

3. 合并样本并校验划分结果

  • 将划分好的稀有类训练样本与普通类训练样本合并,验证集同理。
  • 必须做校验:
    • 验证集中两类稀有类均有样本,且每类样本数至少能支撑稳定评估(建议每类不少于5-10张,避免评估结果波动过大)。
    • 高占比类别在训练/验证集中的像素覆盖占比、出现图像占比,与原数据集的偏差控制在合理范围内(比如±5%)。

4. 可选优化策略

  • 若稀有样本总量极少(比如不足50张),可调整稀有样本的划分比例为7:3(训练:验证),让验证集的稀有类占比略高,更能准确检验模型对稀有类的分割效果。
  • 保留所有样本的多标签掩码信息,确保模型训练时能学习到多类别共存的场景,避免丢失关键关联特征。

内容的提问来源于stack exchange,提问作者ayabp

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 12:05:34