在上一节中,我们讨论了如何把先验“塞进”损失函数(通过额外惩罚项)。但这一节要讲一个更深刻、更“偷懒”的思想:如果我把网络结构本身设计成某种样子,是不是连损失函数里的惩罚项都可以省了?
网络结构本身就是一种强大的隐式先验(Implicit Prior)。
网络结构的归纳偏置(Inductive Bias)——架构即先验
在机器学习中,归纳偏置 指的是:算法对未见过的新数据所做的隐含偏好假设。
-
在传统机器学习中,我们靠特征工程(比如手工设计SIFT、HOG特征)来注入偏置。
-
在深度学习中,我们靠网络结构设计来注入偏置。你搭什么骨架,模型就有什么“性格”。
分析三个经典的网络结构:MLP、CNN、U-Net,以及Deep Image Prior的实验证明
对照组:MLP(全连接网络)——没有任何先验
几乎没有空间先验。在MLP中,输入图像的每一个像素都会被拉平成一个长向量,且每个像素都与下一层的所有神经元相连。
后果:网络不知道像素A在左上角、像素B在右下角。它必须通过大量数据去“死记硬背”空间位置。这导致MLP极其依赖数据量,且缺乏平移不变性(猫移到左上角和右下角,就是完全不同的输入模式)。
CNN(卷积神经网络)——局部性与平移不变性先验
-
局部连接(Local Connectivity):CNN的卷积核只与输入的一小块区域(感受野)做运算。
- 空间就近相关:附近的像素有关系,远处的像素关系弱。
-
权重共享(Weight Sharing):同一个卷积核滑遍全图。
- 空间平移等变性:同一个特征(比如边缘或纹理)无论出现在图片的哪个位置,检测它的方式都是一样的。
-
通道表示(Channel Representation):CNN的每个卷积核可以看作是一个特征探测器,提取不同的局部模式。
- 特征可以被分解为多个“语义通道”
前两个侧重于空间结构的先验,第三个侧重于特征维度的先验。CNN的这些设计让它在图像任务上比MLP更高效、更容易训练。正是因为CNN内置了偏置,它才比MLP更容易学到图像的本质规律。
U-Net——多尺度特征融合先验
-
编码器-解码器结构 —— 低频偏好,偏好生成“平滑、连续、无锯齿”的输出
-
结构构成:U-Net的 编码器 通过连续的池化(Pooling)或步长卷积(Strided Conv),不断缩小特征图尺寸。
-
隐含先验:这个过程本质上是在丢弃高频细节,强制提取低频、全局的语义信息(比如“这是心脏”、“这是脸部轮廓”)。在下采样过程中,随机噪声和尖锐纹理因为缺乏结构性,被大量丢弃。
-
结论:只要网络长成“压缩-解压”的形状,它就天生更容易生成平滑、连续、无噪音的输出。即使你不加TV Loss,U-Net的瓶颈结构也强迫它优先考虑低频成分。这就是它的“去噪基因”。
-
-
跳跃连接(Skip Connections) —— 高分辨率细节的保真
-
结构构成:编码器每层的特征图,直接拼接到解码器对应层的特征图上。
-
隐含先验:跳跃连接引入了对高分辨率细节的保真。
-
关键洞察:这就好比说,“解码器,你不要光听瓶颈那里的‘模糊总结’,你要直接把编码器最初看到的精细边缘信息抄过来!”跳跃连接绕过了下采样的信息损失,强行将高频细节注入到重建图像中。
-
正因如此:U-Net既能利用下采样过滤掉大量不规则的噪声(低频偏好),又能利用跳跃连接保留边缘和纹理(高频保真),实现了完美的“祛噪”与“护边”平衡。
Deep Image Prior 证明
一个随机初始化的、未经任何训练的卷积神经网络(如U-Net),本身就足以作为一个强大的“先验”来捕获自然图像的低级统计特征。通过将一张退化图像(如带噪、模糊或缺损的图)作为唯一的学习目标,并配合早停(Early Stopping) 策略,这个未经训练的神经网络就能在“记住”退化图像的缺陷之前,先“学会”重建出一张干净、清晰的图像
实验设置
这个实验的核心是一个精巧的“图像特定”优化过程,而非传统的大规模数据训练。
输入:一个固定的随机噪声 。在优化过程中保持不变。
网络:一个随机初始化的卷积编码器-解码器网络(如U-Net),其中 是网络参数。
目标:一张退化的观测图像 。
过程:通过梯度下降法优化网络参数 ,使网络输出 尽可能接近目标退化图像 。
关键策略:早停(Early Stopping)。在优化过程中提前终止训练,而非等到网络完全拟合目标图像