全前向层连接神经网络架构的研究现状与反向传播可行性问询
当然有啦!你提到的这种打破「每层仅与下一层相连」约束、允许层与任意后续层连接的架构,不仅早就被研究过,现在已经成为深度学习领域里非常重要的设计思路了。
最具代表性的就是跳连接(Skip Connections)
比如大名鼎鼎的ResNet(残差网络),核心就是通过短连接让底层的特征直接传递到后面的层,避免深层网络训练时的梯度消失问题。这种连接方式本质上就是允许早期层跳过中间层直接和后续层建立连接,完全符合你说的放宽约束的思路。更极端的DenseNet(密集连接网络)
DenseNet把这种连接做到了极致:每一层都会接收前面所有层的输出作为输入,同时自己的输出也会传递给所有后续层。这种密集的连接方式极大提升了特征复用效率,而反向传播在DenseNet里运行得非常顺畅——因为反向传播的核心是链式法则,不管层间连接有多复杂,只要能明确每个节点的梯度传递路径,就能完成参数更新。
你提到的「通过人工创建恒等神经元引入所有早期节点的值(权重固定为1)来模拟」的思路,其实和ResNet里的残差块异曲同工。ResNet里的短连接就是直接将输入的特征映射(近似恒等映射)加到后续层的输出上,本质上就是让早期层的信息不经过复杂变换直接传递下去,和你说的模拟方式核心逻辑一致。
另外,其实早在ResNet之前,就有研究者尝试过类似的非严格分层连接,比如一些带有跨层连接的前馈网络,只是当时没有像ResNet这样解决深层网络训练的痛点,所以没有大规模流行起来。但核心结论是:这种架构完全可行,反向传播也能很好地适配,而且已经在大量实际任务(图像分类、目标检测等)中证明了有效性。
内容的提问来源于stack exchange,提问作者dashnick

