RNN-Seq2Seq序列到序列模型
2026-06-26
前面三种RNN模式要求输入和输出序列等长,但机器翻译这类任务中输入输出长度往往不同,需要一种更灵活的架构。
735 字
|
4 分钟
RNN-概念,三种典型设计模式以及有向图模型解释
2026-06-26
MLP 和 CNN 都假设输入是一个固定大小的向量——样本之间(或像素之间)没有时序依赖。但很多数据天然是序列:文本中的词汇有先后顺序,语音有时间延续,传感器数据按时间步采集。对这些数据,需要能建模时间依赖关系的网络结构。
2168 字
|
11 分钟
视觉先验
2026-06-25
在计算机视觉(特别是底层视觉,如去噪、超分、三维重建)中,我们面临的核心困境是病态问题(Ill-posed Problems)。
1109 字
|
6 分钟
视觉先验-在损失函数中的体现
2026-06-25
核心思想是:将我们对图像的数学或语义假设,直接编码为损失函数中的一个 惩罚项,从而约束模型的优化方向
541 字
|
3 分钟
视觉先验-在低级视觉中的应用
2026-06-25
在深度学习席卷计算机视觉之前,学者们依靠 数学建模和信号处理 将先验知识编码为精确的公式。这些手工设计的先验(Hand-crafted Priors)主导了底层视觉领域长达数十年,其核心思想至今仍深刻影响着现代神经网络的设计(例如,ResNet的残差结构就是对“噪声残差稀疏性”的先验继承)。
1836 字
|
9 分钟
Stereo Vision(立体视觉)- 双目相机与对极几何
2026-06-25
单目相机模型 \mathbf{x} = K [R|t] X 只能描述“一个相机看到什么”,无法恢复深度信息——因为无数个不同深度的三维点都可能投影到同一个像素点上。
2664 字
|
13 分钟
Stereo Vision(立体视觉)- 几何基础
2026-06-25
三维世界点 X 到二维图像点 \mathbf{x} 的映射统一表示为:
1623 字
|
8 分钟
Stereo Vision(立体视觉)- 三维表示与重建
2026-06-25
这部分是3D视觉的“地基”,核心是回答:三维数据在计算机里以什么格式存在?
2442 字
|
12 分钟