1109 字
6 分钟
视觉先验
2026-06-25
无标签

第一节:视觉先验——定义、数学形式与信息源头#

在计算机视觉(特别是底层视觉,如去噪、超分、三维重建)中,我们面临的核心困境是病态问题(Ill-posed Problems)

给你一张模糊的2D图像(观测值 XX),要你推测出清晰的3D场景或原始高清图(未知变量 θ\theta)。这个映射往往是“一对多”的——无穷多个清晰的原始场景可以退化成同一张模糊图像。如果没有额外的限制条件,计算机无法确定该选哪一个。

先验(Prior) 就是解决这个问题的关键。它告诉模型:在你看这张图之前,真实的自然世界普遍遵循哪些规律(比如边缘是平滑的、物体是连续的、天空不是紫色的)。

贝叶斯公式#

P(θX)P(Xθ)P(θ)P(\theta | X) \propto P(X | \theta) \cdot P(\theta)
  • XX(观测数据 / Evidence)

    • 语义:我们手里已有的、被退化的输入。在视觉任务中,它代表观测到的图像(低分辨率图、带噪声的灰度图、带遮挡的点云等)。
    • 注意XX 是已知的、固定不变的输入。
  • θ\theta(未知变量 / Parameters)

    • 语义:我们想要通过算法“猜”出来的真实世界状态。在计算机视觉中,θ\theta 可以指代多种目标,例如:
      • 重建任务:高分辨率的清晰图像、被修复的老照片。
      • 几何任务:场景的深度图(Depth)、三维点云坐标(Point Cloud)。
      • 识别任务:物体的离散类别标签(猫/狗)或连续的光照强度(Illumination)。
  • P(θ)P(\theta)(先验概率 / Prior)

    • 语义在没有看到当前图片之前,我们对 θ\theta 的固有假设。比如“自然图像梯度是稀疏的”、“物体不可能悬浮在空中”。
  • P(Xθ)P(X|\theta)(似然概率 / Likelihood)

    • 语义:假设真实的 θ\theta 已知,当前观测到的退化图像 XX 出现的概率。它通常由 成像模型(Forward Model) 决定(比如:高清图经过模糊核下采样 + 高斯噪声 = 低分辨率图)。在深度学习损失函数中,它通常对应着 MSE(均方误差)或 L1 损失,用来衡量重建结果与输入是否“像”。
  • P(θX)P(\theta | X)(后验概率 / Posterior)

    • 语义:这是我们要的结果。给定退化图 XX 后,真实高清图 θ\theta 的条件概率。后验 \propto 似然 ×\times 先验。

为了便于计算,我们通常将最大化后验概率(MAP估计)转化为最小化能量函数:

θ=argmaxθlogP(Xθ)+logP(θ)\theta^*= \arg \max_{\theta} \log P(X|\theta) + \log P(\theta)

等价于:

θ=argminθlogP(Xθ)Data Term (数据项)+(logP(θ))Regularization Term (正则项/先验项)\theta^* = \arg \min_{\theta} \underbrace{-\log P(X|\theta)}_{\text{Data Term (数据项)}} + \underbrace{(-\log P(\theta))}_{\text{Regularization Term (正则项/先验项)}}
  • 这里的数据项确保重建结果不能偏离退化输入太多(保真度)。
  • 这里的正则项就是先验的具体函数表达(如平滑约束)。传统算法和深度学习算法的本质区别之一,就在于如何用函数 f(θ)f(\theta) 来表达这个 logP(θ)-\log P(\theta)

觉先验的三大信息源头#

PPT将先验的信息来源分为三类,这里我补充一些具体的、易于理解的实例:

源头分类核心思想PPT/补充举例作用场景
1. 物理几何约束遵循客观物理定律和欧几里得几何规则。PPT举例:物体不能悬空(重力先验)、两面墙互相垂直(Manhattan World先验)。
博主补充:光照阴影一致性(同一光源下,物体表面亮度分布必须符合光照方程)。
三维重建、SLAM、单目深度估计。
2. 数据统计约束基于对海量自然图像数据分布(Natural Image Statistics)的观测。PPT举例:天空是蓝色的、草是绿色的。自然界中,干净图像的能量谱密度通常随频率升高而衰减(呈 1/f1/f 分布),而噪声能量分布均匀。这是去噪算法的底层统计依据。图像色彩校正、白平衡、风格迁移。
3. 人为偏好(认知/设计)人类工程经验沉淀出的数学稀疏性约束,不一定严格符合物理定律,但极其有效。PPT举例:自然图像梯度稀疏(Total Variation)、神经网络权重不要太大(L2正则化)。低秩性(Low-rank Prior,如背景建模中,静止背景的矩阵秩很低)。超分复原、模型防过拟合、去雨去雾。
视觉先验
https://biscuit0613.github.io/posts/cv/cv-prior/
作者
Biscuit
发布于
2026-06-25
许可协议
CC BY-NC-SA 4.0
RNN-概念,三种典型设计模式以及有向图模型解释
视觉先验-在损失函数中的体现