PointNet模型中T-Net模块实现疑问:为何添加单位矩阵?
PointNet中T-Net模块的实现疑问:回归矩阵加单位矩阵的合理性?
我正在阅读PointNet论文,尝试理解模型中T-Net模块的实现方式(输入变换与特征变换思路一致)。我查阅的所有PyTorch实现均采用如下代码片段:
class STNkd(nn.Module): def __init__(self, k=64): super(STNkd, self).__init__() self.conv1 = torch.nn.Conv1d(k, 64, 1) self.conv2 = torch.nn.Conv1d(64, 128, 1) self.conv3 = torch.nn.Conv1d(128, 1024, 1) self.fc1 = nn.Linear(1024, 512) self.fc2 = nn.Linear(512, 256) self.fc3 = nn.Linear(256, k*k) self.relu = nn.ReLU() self.bn1 = nn.BatchNorm1d(64) self.bn2 = nn.BatchNorm1d(128) self.bn3 = nn.BatchNorm1d(1024) self.bn4 = nn.BatchNorm1d(512) self.bn5 = nn.BatchNorm1d(256) self.k = k def forward(self, x): batchsize = x.size()[0] x = F.relu(self.bn1(self.conv1(x))) x = F.relu(self.bn2(self.conv2(x))) x = F.relu(self.bn3(self.conv3(x))) x = torch.max(x, 2, keepdim=True)[0] x = x.view(-1, 1024) x = F.relu(self.bn4(self.fc1(x))) x = F.relu(self.bn5(self.fc2(x))) x = self.fc3(x) iden = Variable(torch.from_numpy(np.eye(self.k).flatten().astype(np.float32))).view(1,self.k*self.k).repeat(batchsize,1) if x.is_cuda: iden = iden.cuda() x = x + iden x = x.view(-1, self.k, self.k) return x
我能理解大部分步骤,但到iden部分存在疑问:代码中将回归得到的矩阵与单位矩阵相加,这是否合理?
根据论文描述:
- 输出矩阵初始化为单位矩阵。
- 特征变换矩阵需接近正交矩阵。
第二点很明确,只需在最终损失中添加(I - xx^T)^2项即可。但第一点令我困惑:该矩阵实际由网络预测,而代码中(甚至推理阶段)每次都添加单位矩阵,这显然不是“初始化”操作。
恳请有人厘清论文描述与代码实现之间的差异。
内容的提问来源于stack exchange,提问作者Antonios Sarikas
相关产品推荐
相关产品推荐

