605 字
3 分钟
视觉先验-预训练GAN的生成先验
2026-07-01
无标签

在 DIP 之前我们看到随机网络结构本身就能充当图像先验。那么更进一步:一个在海量自然图像上预训练好的 GAN 生成器,它所编码的隐空间是否蕴含了更强的图像先验?答案是肯定的。

生成式先验的核心主张#

传统底层视觉范式:输入退化图 → 端到端训练去噪/超分网络 → 输出干净图,学习的是”退化→干净”的映射。

生成式先验范式:输入退化图 → 在预训练 GAN 的隐空间中搜索 → 找到最优隐码 → 生成器输出干净图。学习的不是”如何做复原”,而是”如何把一张图投影到自然图像流形上”。

这个流形由 GAN 的训练数据定义:在 FFHQ 上训练的 StyleGAN 学到的流形上一张图必定是人脸,不会出现不属于人脸的伪影。这种结构化的先验对处理图像复原中的病态问题(一张低分辨率图对应无数张高分辨率图)有天然优势——它只在流形上搜索,排除了所有非自然图像的解。

隐空间谱系#

生成式先验的核心操作对象是 GAN 的隐空间。不同 GAN 架构和不同任务会选择不同的隐空间,Z / W / W+ / F / N 各有适用场景。各空间的具体定义、解耦性质和使用方法将在 GAN 系列中逐篇展开。

反演方法#

将真实图像映射回隐空间的四类方法也将在后文中详细讲解:

  • 基于优化:逐张图梯度下降,质量高速度慢
  • 基于学习:编码器一步推理,速度快精度稍低
  • 混合方法:编码器初值 + 优化精修
  • 域内约束:限制结果必须落在自然图像流形上

后面几篇将按照”理论→架构→隐空间→反演→编辑”的顺序完整覆盖 GAN 的计算机视觉应用。

:::tip 本系列 GAN 篇章索引

篇章内容衔接
CV-GAN-Theory.mdGAN收敛性 + WGAN为什么 GAN 能学分布
CV-GAN-Variants.mdDCGAN → cGAN架构演进基础
CV-GAN-StyleGAN.mdMapping/Synthesis/AdaIN引出解耦隐空间
CV-GAN-LatentSpace.mdZ/W/W+/F/N隐空间全谱系
CV-GAN-Inversion.mdPULSE/pSp/GPEN怎么把图片映射进去
CV-GAN-Edit.mdI2S/GANSpace/StyleCLIP进去之后能做什么

:::

视觉先验-预训练GAN的生成先验
https://biscuit0613.github.io/posts/cv/cv-generativeprior/
作者
Biscuit
发布于
2026-07-01
许可协议
CC BY-NC-SA 4.0
GAN理论基础:收敛性、最优解与WGAN
GAN变体:DCGAN与条件GAN