You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在特征第三维通道做卷积或全连接以计算每个图像块的标量分数

方案说明

你的核心思路没有问题,1x1卷积和全连接两种方案都可以实现需求,只需要补全输出维度的调整步骤即可:

1. 1x1卷积方案修正

你当前的卷积写法是对的,1x1卷积刚好会对每个空间位置(即13*13的每个图像块)的64维特征做线性变换,输出对应分数,只需要调整输出维度匹配你的标签形状即可:

class ADModel(nn.Module):
    def __init__(self):
        super(ADModel, self).__init__()
        self.conv = nn.Conv2d(in_channels=64, out_channels=1, kernel_size=1, padding=0)
   
    def forward(self, feature):    
        scores = self.conv(feature) # 输出形状为 (batch_size, 1, 13, 13)
        # 按需选择输出形状
        # 选项1:保留空间结构,输出 (batch_size, 13, 13)
        return scores.squeeze(1)
        # 选项2:直接展平为169个分数,输出 (batch_size, 169)
        # return scores.flatten(1)

该方案可直接复用你现有训练代码里的transpose操作,不需要调整数据预处理逻辑。

2. 全连接方案实现

全连接和1x1卷积在该场景下数学等价,实现时只需要调整特征维度顺序即可:

class ADModelFC(nn.Module):
    def __init__(self):
        super(ADModelFC, self).__init__()
        self.fc = nn.Linear(64, 1)
   
    def forward(self, feature):    
        # 输入使用原始形状的特征:(batch_size, 13, 13, 64),不需要transpose
        feature = feature.flatten(1, 2) # 合并空间维度,形状变为 (batch_size, 169, 64)
        scores = self.fc(feature) # 输出形状为 (batch_size, 169, 1)
        return scores.squeeze(-1) # 最终输出 (batch_size, 169)

使用该方案时,训练代码中可以删除np.transpose(fe, (0, 3, 1, 2))这一步。


效果优化建议

如果基础线性模型效果达不到预期,可以增加网络深度提升拟合能力:

  • 卷积方案可以在两层1x1卷积之间加入激活函数,例如Conv2d(64, 32, 1) -> ReLU() -> Conv2d(32, 1, 1)
  • 全连接方案同理,可以叠加多层线性层和激活函数,例如Linear(64, 32) -> ReLU() -> Linear(32, 1)

内容的提问来源于stack exchange,提问作者Lykas Lin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 03:27:03