You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

生成对抗网络(GAN)中Generator(生成器)各层的运行机制是什么?

GAN生成器(解码器)各层运行逻辑

你熟悉的分类深度神经网络、MLP的特征提取逻辑是典型的「编码」流程:输入高维的图像像素,每层逐步压缩空间尺寸、提取更抽象的特征,前层抓边缘、纹理等基础元素,后层组合出物体、场景这类高阶语义,最终输出低维的分类结果。GAN的生成器(解码器)刚好是完全反向的「解码」流程,从低维噪声输入逐步生成高分辨率图像,各层的运行逻辑如下:

输入层:低维噪声的语义映射

  • 输入一般是100~1000维的随机采样向量(服从正态分布或均匀分布),这个向量隐式编码了要生成目标的所有全局属性,比如生成人脸的话,向量的不同维度可能对应性别、发型、肤色、拍摄角度这些抽象特征。
  • 第一层会通过全连接或转置卷积操作,把一维的噪声向量映射为小尺寸、高通道数的三维特征图,比如常见配置是把100维噪声转为4×4×1024的特征图。这个小尺寸高通道的特征图,对应分类网络最后一层输出的高阶语义特征,已经确定了生成内容的全局框架。

中间上采样层:逐层还原具象细节

  • 每一层都会对输入特征图做上采样+卷积操作:先把特征图的宽高放大2倍(常见实现为转置卷积,或上采样后接普通卷积),再把通道数压缩一半,比如4×4×1024→8×8×512→16×16×256→32×32×128,逐层放大直到接近目标输出尺寸。
  • 越靠近噪声输入的层,处理的特征越抽象:比如生成人脸时,8×8尺寸的层会确定人脸轮廓、五官大致位置;16×16尺寸的层会细化眉毛、眼睛、鼻子的具体形状;32×32尺寸的层开始生成头发纹理、皮肤质感这类细节。
  • 特征组合逻辑和分类网络完全反向:分类是把低阶特征拼接组合成高阶特征,生成器是把高阶抽象特征拆解为多个低阶具象特征,上层确定的大结构不会被下层推翻,下层只在上层的框架内填充细节。你之前看到的分类网络特征层级示例,倒过来看就是生成器的特征流动逻辑。

输出层:映射为可可视化像素

  • 最后一层的特征图尺寸和目标输出图像完全一致,比如要生成256×256的RGB图像,最后一层输出就是256×256×3的特征图。
  • 通常会用Tanh激活函数把输出值归一化到[-1,1]或[0,1]的像素取值区间,最终输出即可直接转换为可视化的图像。

内容的提问来源于stack exchange,提问作者leon luo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 00:15:04