605 字
3 分钟
视觉先验-预训练GAN的生成先验
在 DIP 之前我们看到随机网络结构本身就能充当图像先验。那么更进一步:一个在海量自然图像上预训练好的 GAN 生成器,它所编码的隐空间是否蕴含了更强的图像先验?答案是肯定的。
生成式先验的核心主张
传统底层视觉范式:输入退化图 → 端到端训练去噪/超分网络 → 输出干净图,学习的是”退化→干净”的映射。
生成式先验范式:输入退化图 → 在预训练 GAN 的隐空间中搜索 → 找到最优隐码 → 生成器输出干净图。学习的不是”如何做复原”,而是”如何把一张图投影到自然图像流形上”。
这个流形由 GAN 的训练数据定义:在 FFHQ 上训练的 StyleGAN 学到的流形上一张图必定是人脸,不会出现不属于人脸的伪影。这种结构化的先验对处理图像复原中的病态问题(一张低分辨率图对应无数张高分辨率图)有天然优势——它只在流形上搜索,排除了所有非自然图像的解。
隐空间谱系
生成式先验的核心操作对象是 GAN 的隐空间。不同 GAN 架构和不同任务会选择不同的隐空间,Z / W / W+ / F / N 各有适用场景。各空间的具体定义、解耦性质和使用方法将在 GAN 系列中逐篇展开。
反演方法
将真实图像映射回隐空间的四类方法也将在后文中详细讲解:
- 基于优化:逐张图梯度下降,质量高速度慢
- 基于学习:编码器一步推理,速度快精度稍低
- 混合方法:编码器初值 + 优化精修
- 域内约束:限制结果必须落在自然图像流形上
后面几篇将按照”理论→架构→隐空间→反演→编辑”的顺序完整覆盖 GAN 的计算机视觉应用。
:::tip 本系列 GAN 篇章索引
| 篇章 | 内容 | 衔接 |
|---|---|---|
| CV-GAN-Theory.md | GAN收敛性 + WGAN | 为什么 GAN 能学分布 |
| CV-GAN-Variants.md | DCGAN → cGAN | 架构演进基础 |
| CV-GAN-StyleGAN.md | Mapping/Synthesis/AdaIN | 引出解耦隐空间 |
| CV-GAN-LatentSpace.md | Z/W/W+/F/N | 隐空间全谱系 |
| CV-GAN-Inversion.md | PULSE/pSp/GPEN | 怎么把图片映射进去 |
| CV-GAN-Edit.md | I2S/GANSpace/StyleCLIP | 进去之后能做什么 |
:::
视觉先验-预训练GAN的生成先验
https://biscuit0613.github.io/posts/cv/cv-generativeprior/