973 字
5 分钟
GAN隐空间:Z、W、W+、F与N
2026-07-01
无标签

StyleGAN 的 Mapping Network 和层级化 Synthesis Network 创造了一个丰富的隐空间谱系。不同的空间适合不同的任务,理解它们的区别是掌握基于 GAN 的图像编辑和反演的前提。

Z 空间#

ZZ 是生成器的原始输入空间,服从各向同性的标准高斯分布 N(0,I)\mathcal{N}(0, I)。维度通常为 512。

  • 特点:分布固定,采样简单,但空间密度均匀——每个方向方差相同,语义方向不明确。
  • 用途:训练时的采样来源。
  • 局限:直接在这个空间上做反演和编辑非常困难,因为任何方向的变化都会耦合影响到所有生成属性。

W 空间#

Mapping Network 的输出空间。由 MLP 将 ZZ 映射到 WW,分布由数据隐式定义,不再服从高斯分布。

  • 特点:各向异性,不同方向对应不同的语义属性。解耦性比 ZZ 好得多。
  • 用途:Truncation Trick 在 WW 上操作。GANSpace 和 SeFa 等方向探索方法在 WW 上寻找语义编辑方向。
  • 局限:只有一个 ww 控制所有生成层,无法对不同层级的属性做独立调整。

W+ 空间#

由 Image2StyleGAN(Abdul et al., 2019)提出。W+={w1,w2,,w18}W^+ = \{w_1, w_2, \dots, w_{18}\},每个 wiR512w_i \in \mathbb{R}^{512},为 Synthesis Network 的每一层(共 18 层)分配一个独立的风格向量。

  • 特点:自由度从 512 扩展到 18×512=921618 \times 512 = 9216,表达能力远超 WW。每一层的风格向量独立控制对应分辨率级别的特征,实现了属性间的解耦编辑。
  • 用途:GAN 反演的事实标准空间。pSp、GPEN 等几乎所有现代反演方法都输出到 W+W^+。在 W+W^+ 上做编辑可以精确定位到某一层级而保持其他层级不变。
  • 问题:自由度增大带来了过度拟合的风险——反演可能把噪声也编入 W+W^+ 导致重建完美但失去编辑能力(违反了”隐码在流形上”的先验假设)。

F 空间#

生成器中间层的特征图空间。Synthesis Network 在每一层输出一组特征图 FRH×W×CF \in \mathbb{R}^{H \times W \times C}

  • 特点:保留了空间结构信息。位置 (x,y)(x,y)FF 中对应图像空间的一个局部区域。
  • 用途:局部编辑(只修改某个区域的 FF)、图像填充(补全被遮盖区域的 FF)。Image2StyleGAN++ 的局部风格迁移就是在 FF 空间上操作的。
  • W+W^+ 的关系W+W^+ 是全局风格码(每层一个向量),FF 是空间特征图(每层一个张量)。两者可以组合使用来兼顾全局风格和局部编辑。

N 空间#

随机噪声输入空间,由 Image2StyleGAN++(Abdul et al., 2020)引入。StyleGAN 的合成网络每层还会接收一个随机噪声图 NiN_i(与特征图同尺寸的单通道噪声),用于生成随机细节(发丝、毛孔等)。

  • 特点:控制生成结果中的随机变化,如皮肤纹理、头发丝位置。修改 NN 空间只改变细节而不改变整体结构和颜色。
  • 用途:跨图像风格迁移时保留原始图像的随机细节。GPEN 在盲人脸复原中也利用了 NN 空间来恢复纹理级细节。
  • 特点:不影响生成图像的身份和语义内容。

各空间对比总表#

空间维度定义位置解耦程度表达能力编辑精度典型用途
Z512Mapping 输入随机采样
W512Mapping 输出方向探索、截断
W+18×512各层 AdaIN 输入精细反演、层级编辑
F可变生成器中间层空间精确局部编辑、填充
N可变噪声注入层像素级纹理细节迁移

:::tip TODO

在此处插入各隐空间在 StyleGAN 架构中的位置示意图

:::

GAN隐空间:Z、W、W+、F与N
https://biscuit0613.github.io/posts/cv/cv-gan-latentspace/
作者
Biscuit
发布于
2026-07-01
许可协议
CC BY-NC-SA 4.0
GAN反演:PULSE、pSp与GPEN
StyleGAN:解耦隐空间与层级化生成