1375 字
7 分钟
视觉先验-在神经网络结构中的体现
2026-06-26
无标签

在上一节中,我们讨论了如何把先验“塞进”损失函数(通过额外惩罚项)。但这一节要讲一个更深刻、更“偷懒”的思想:如果我把网络结构本身设计成某种样子,是不是连损失函数里的惩罚项都可以省了?

网络结构本身就是一种强大的隐式先验(Implicit Prior)。

网络结构的归纳偏置(Inductive Bias)——架构即先验#

在机器学习中,归纳偏置 指的是:算法对未见过的新数据所做的隐含偏好假设。

  • 在传统机器学习中,我们靠特征工程(比如手工设计SIFT、HOG特征)来注入偏置。

  • 在深度学习中,我们靠网络结构设计来注入偏置。你搭什么骨架,模型就有什么“性格”。

分析三个经典的网络结构:MLP、CNN、U-Net,以及Deep Image Prior的实验证明

对照组:MLP(全连接网络)——没有任何先验#

几乎没有空间先验。在MLP中,输入图像的每一个像素都会被拉平成一个长向量,且每个像素都与下一层的所有神经元相连。

后果:网络不知道像素A在左上角、像素B在右下角。它必须通过大量数据去“死记硬背”空间位置。这导致MLP极其依赖数据量,且缺乏平移不变性(猫移到左上角和右下角,就是完全不同的输入模式)。

CNN(卷积神经网络)——局部性与平移不变性先验#

  1. 局部连接(Local Connectivity):CNN的卷积核只与输入的一小块区域(感受野)做运算。

    • 空间就近相关:附近的像素有关系,远处的像素关系弱。
  2. 权重共享(Weight Sharing):同一个卷积核滑遍全图。

    • 空间平移等变性:同一个特征(比如边缘或纹理)无论出现在图片的哪个位置,检测它的方式都是一样的。
  3. 通道表示(Channel Representation):CNN的每个卷积核可以看作是一个特征探测器,提取不同的局部模式。

    • 特征可以被分解为多个“语义通道”

前两个侧重于空间结构的先验,第三个侧重于特征维度的先验。CNN的这些设计让它在图像任务上比MLP更高效、更容易训练。正是因为CNN内置了偏置,它才比MLP更容易学到图像的本质规律。

U-Net——多尺度特征融合先验#

  1. 编码器-解码器结构 —— 低频偏好,偏好生成“平滑、连续、无锯齿”的输出

    • 结构构成:U-Net的 编码器 通过连续的池化(Pooling)或步长卷积(Strided Conv),不断缩小特征图尺寸。

    • 隐含先验:这个过程本质上是在丢弃高频细节,强制提取低频、全局的语义信息(比如“这是心脏”、“这是脸部轮廓”)。在下采样过程中,随机噪声和尖锐纹理因为缺乏结构性,被大量丢弃。

    • 结论:只要网络长成“压缩-解压”的形状,它就天生更容易生成平滑、连续、无噪音的输出。即使你不加TV Loss,U-Net的瓶颈结构也强迫它优先考虑低频成分。这就是它的“去噪基因”。

  2. 跳跃连接(Skip Connections) —— 高分辨率细节的保真

    • 结构构成:编码器每层的特征图,直接拼接到解码器对应层的特征图上。

    • 隐含先验:跳跃连接引入了对高分辨率细节的保真。

    • 关键洞察:这就好比说,“解码器,你不要光听瓶颈那里的‘模糊总结’,你要直接把编码器最初看到的精细边缘信息抄过来!”跳跃连接绕过了下采样的信息损失,强行将高频细节注入到重建图像中。

正因如此:U-Net既能利用下采样过滤掉大量不规则的噪声(低频偏好),又能利用跳跃连接保留边缘和纹理(高频保真),实现了完美的“祛噪”与“护边”平衡。

Deep Image Prior 证明#

一个随机初始化的、未经任何训练的卷积神经网络(如U-Net),本身就足以作为一个强大的“先验”来捕获自然图像的低级统计特征。通过将一张退化图像(如带噪、模糊或缺损的图)作为唯一的学习目标,并配合早停(Early Stopping) 策略,这个未经训练的神经网络就能在“记住”退化图像的缺陷之前,先“学会”重建出一张干净、清晰的图像

实验设置

这个实验的核心是一个精巧的“图像特定”优化过程,而非传统的大规模数据训练。

输入:一个固定的随机噪声 zz 。在优化过程中保持不变。

网络:一个随机初始化的卷积编码器-解码器网络(如U-Net)fθ(z)f_\theta(z),其中 θ\theta 是网络参数。

目标:一张退化的观测图像 x0=x+noisex_0=x^*+\text{noise}

过程:通过梯度下降法优化网络参数 θ\theta,使网络输出 fθ(z)f_\theta(z) 尽可能接近目标退化图像 x0x_0

关键策略:早停(Early Stopping)。在优化过程中提前终止训练,而非等到网络完全拟合目标图像

视觉先验-在神经网络结构中的体现
https://biscuit0613.github.io/posts/cv/cv-priorinnetstructure/
作者
Biscuit
发布于
2026-06-26
许可协议
CC BY-NC-SA 4.0
Trasformer-编码器的其他部分:位置编码
RNN-BPTT,梯度消失与梯度爆炸以及对应的解决方案