You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为FOVE HMD生成无需手动干预的自动图像掩码?

寻求FOVE头戴设备掩码生成的可行方案

我手头有一个包含佩戴HMD(头戴显示设备)人员的数据集,现在需要专门为其中的FOVE头戴设备生成掩码,示例效果如下:
FOVE掩码示例

我一开始尝试过语义分割模型,这类模型能生成人物的整体轮廓,但没法单独识别FOVE设备——毕竟它不是模型的预设类别。又没有对应的掩码数据来重新训练模型,所以我转而尝试图像处理方法,试过MeanShift算法、KMeans算法、图像阈值分割以及GrabCut算法,但都遇到了各自的问题:

  • Mean-Shift聚类:生成的类别太多(超过1000个)。因为要处理2000多张图,我希望能自动提取FOVE类别,不用手动干预。我给输入图像做了平滑处理后,类别数量有所减少,但FOVE设备内部因为亮度梯度差异被拆成了多个类别;另外,很多图像的背景和示例类似,MeanShift在这类场景里很容易混淆。
    MeanShift输出结果

  • KMeans:输出质量很低,识别混淆又不准确,下面是k=10时的输出结果。
    KMeans输出结果(k=10)

  • 图像阈值分割:用自适应阈值分割能生成FOVE设备的清晰轮廓,但我不知道怎么通过这个结果提取HMD的坐标。
    自适应阈值分割输出

  • GrabCut:输出效果差还需要手动干预。补充一下:GrabCut需要输入贴近面部的边界框,手动给2000张图预处理显然不现实;如果用通用的大边界框,准确率又会下降,所以我优先想尝试不需要手动输入的方法。
    GrabCut输出结果

目前我自己用的方案是这样的:最棘手的就是背景问题——数据集中的背景有时候和FOVE只有细微的亮度差异,有时候又完全不同。我训练了一个语义分割网络来检测并提取图像里的人物,参考了CRFasRNN和Mask RCNN这类项目。之后再用MeanShift算法做聚类,配合颜色阈值分割。这个方案的准确率大概有90%,剩下的图像需要调整参数(主要是颜色阈值)。
语义分割得到的掩码
生成的最终掩码

想请大家帮我提供更优的生成HMD掩码的可行方案。


内容的提问来源于stack exchange,提问作者lee huang

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.28 06:23:36