基于预训练ResNet34的U-net裁剪输出适配处理方案咨询
关于无same padding U-net输出对齐的最佳实践(针对头影测量关键点检测场景)
- 直接resize输出:完全不推荐。你的任务是关键点检测,依赖输出热图的峰值位置定位坐标,resize会直接导致峰值偏移,关键点定位误差明显上升,对小数据集训练的模型精度影响更大。
- 无依据外围填充:不要直接随便在外围补像素,你首先要明确:原生无same padding的U-net输出的388x388结果,对应输入572x572的中心388x388区域,上下左右各有92像素的边缘区域是模型没有预测能力的,因为编码器下采样过程中无padding,这些边缘区域没有被完整的感受野覆盖,本身就得不到有效预测结果,不存在“丢失边界信息”的问题,本来就预测不了。
场景1:关键点不会出现在输入图像边缘92像素范围内
头影测量的关键点基本都集中在颅骨中心区域,符合这个情况:
- 训练阶段:提前把标注的热图/分割mask裁剪为中心388x388的尺寸,和模型输出对齐后计算损失,避免错位带来的精度损失。
- 推理阶段:如果需要和输入同尺寸的结果,直接把388x388的预测结果贴到572x572画布的中心位置,边缘92像素区域直接标记为无效即可,完全不影响正常关键点的提取使用。
场景2:需要覆盖边缘区域的预测结果
如果你确实需要得到全输入尺寸的有效预测,在不改动预训练ResNet编码器结构的前提下,用输入前镜像填充的方案:
输入模型前,给572x572的输入图像上下左右各做92像素的镜像填充,得到756x756的输入尺寸,输入到模型后输出的结果正好是572x572,和原输入尺寸完全对齐,镜像填充不会引入外来伪影,也不会影响预训练权重的特征提取效果。
内容的提问来源于stack exchange,提问作者kelvin hong 方
相关产品推荐
相关产品推荐

