Vision Transformer能否用于图像输出任务?求相关代码仓库链接
Vision Transformer在图像生成类任务中的应用
- 当然可以。Vision Transformer(ViT)早已被拓展到图像生成、图像修复、超分辨率等输出为图像的任务中,核心思路是调整模型的输出结构,把原本分类任务的线性分类头替换成能生成图像像素/特征的模块。
- 针对这类任务的ViT衍生架构,最后几层通常会做这些关键调整:
- 去掉分类任务专用的
clstoken,转而用序列输出的特征图来还原图像空间信息 - 增加像素解码层,将Transformer输出的序列特征映射回图像的高维像素空间
- 部分架构会引入位置重建模块,弥补Transformer对空间位置信息的依赖,确保输出图像的结构合理性
- 去掉分类任务专用的
- 常见的这类模型包括:
- DALL-E系列:基于ViT的文本到图像生成模型,最后几层通过多层感知机(MLP)和上采样模块生成图像
- ViT-GAN:结合ViT与生成对抗网络的图像生成模型,判别器和生成器都采用Transformer结构
- Restormer:用于图像修复、超分辨率的ViT衍生模型,最后几层通过堆叠的Transformer块输出高分辨率特征,再解码为图像
内容的提问来源于stack exchange,提问作者cbd
相关产品推荐
相关产品推荐

