1109 字
6 分钟
视觉先验
第一节:视觉先验——定义、数学形式与信息源头
在计算机视觉(特别是底层视觉,如去噪、超分、三维重建)中,我们面临的核心困境是病态问题(Ill-posed Problems)。
给你一张模糊的2D图像(观测值 ),要你推测出清晰的3D场景或原始高清图(未知变量 )。这个映射往往是“一对多”的——无穷多个清晰的原始场景可以退化成同一张模糊图像。如果没有额外的限制条件,计算机无法确定该选哪一个。
先验(Prior) 就是解决这个问题的关键。它告诉模型:在你看这张图之前,真实的自然世界普遍遵循哪些规律(比如边缘是平滑的、物体是连续的、天空不是紫色的)。
贝叶斯公式
-
(观测数据 / Evidence):
- 语义:我们手里已有的、被退化的输入。在视觉任务中,它代表观测到的图像(低分辨率图、带噪声的灰度图、带遮挡的点云等)。
- 注意: 是已知的、固定不变的输入。
-
(未知变量 / Parameters):
- 语义:我们想要通过算法“猜”出来的真实世界状态。在计算机视觉中, 可以指代多种目标,例如:
- 重建任务:高分辨率的清晰图像、被修复的老照片。
- 几何任务:场景的深度图(Depth)、三维点云坐标(Point Cloud)。
- 识别任务:物体的离散类别标签(猫/狗)或连续的光照强度(Illumination)。
- 语义:我们想要通过算法“猜”出来的真实世界状态。在计算机视觉中, 可以指代多种目标,例如:
-
(先验概率 / Prior):
- 语义:在没有看到当前图片之前,我们对 的固有假设。比如“自然图像梯度是稀疏的”、“物体不可能悬浮在空中”。
-
(似然概率 / Likelihood):
- 语义:假设真实的 已知,当前观测到的退化图像 出现的概率。它通常由 成像模型(Forward Model) 决定(比如:高清图经过模糊核下采样 + 高斯噪声 = 低分辨率图)。在深度学习损失函数中,它通常对应着 MSE(均方误差)或 L1 损失,用来衡量重建结果与输入是否“像”。
-
(后验概率 / Posterior):
- 语义:这是我们要的结果。给定退化图 后,真实高清图 的条件概率。后验 似然 先验。
为了便于计算,我们通常将最大化后验概率(MAP估计)转化为最小化能量函数:
等价于:
- 这里的数据项确保重建结果不能偏离退化输入太多(保真度)。
- 这里的正则项就是先验的具体函数表达(如平滑约束)。传统算法和深度学习算法的本质区别之一,就在于如何用函数 来表达这个 。
觉先验的三大信息源头
PPT将先验的信息来源分为三类,这里我补充一些具体的、易于理解的实例:
| 源头分类 | 核心思想 | PPT/补充举例 | 作用场景 |
|---|---|---|---|
| 1. 物理几何约束 | 遵循客观物理定律和欧几里得几何规则。 | PPT举例:物体不能悬空(重力先验)、两面墙互相垂直(Manhattan World先验)。 博主补充:光照阴影一致性(同一光源下,物体表面亮度分布必须符合光照方程)。 | 三维重建、SLAM、单目深度估计。 |
| 2. 数据统计约束 | 基于对海量自然图像数据分布(Natural Image Statistics)的观测。 | PPT举例:天空是蓝色的、草是绿色的。自然界中,干净图像的能量谱密度通常随频率升高而衰减(呈 分布),而噪声能量分布均匀。这是去噪算法的底层统计依据。 | 图像色彩校正、白平衡、风格迁移。 |
| 3. 人为偏好(认知/设计) | 人类工程经验沉淀出的数学稀疏性约束,不一定严格符合物理定律,但极其有效。 | PPT举例:自然图像梯度稀疏(Total Variation)、神经网络权重不要太大(L2正则化)。低秩性(Low-rank Prior,如背景建模中,静止背景的矩阵秩很低)。 | 超分复原、模型防过拟合、去雨去雾。 |