Trasformer-ViT视觉Transformer
2026-06-28
其实Vit 的问题就是如何让transformer像处理 NLP 任务一样处理图像任务。ViT的输入是图像,输出是分类结果。ViT的核心思想就是把图像切成小块(patch),然后把这些小块当作一个序列输入到transformer中进行处理。这里重点讲编码的过程。
1351 字
|
7 分钟
Trasformer-OtherPartsInEncoder-FFN
2026-06-28
这里讲解 Transformer Block 中的前馈网络(Feed Forward Network,FFN)。它是编码器和解码器中的重要子层,通常位于多头注意力子层之后。
1205 字
|
6 分钟
Trasformer-编码器核心:self-attention自注意力机制
2026-06-27
Transformer的架构由编码器(Encoder) 和解码器(Decoder) 两大部分组成
4391 字
|
22 分钟
视觉先验-在神经网络结构中的体现
2026-06-26
在上一节中,我们讨论了如何把先验“塞进”损失函数(通过额外惩罚项)。但这一节要讲一个更深刻、更“偷懒”的思想:如果我把网络结构本身设计成某种样子,是不是连损失函数里的惩罚项都可以省了?
1375 字
|
7 分钟
RNN-双向RNN
2026-06-26
标准RNN在计算 h^{(t)} 时,只能看到过去的信息 x^{(1)}, \ldots, x^{(t)},但很多任务中当前时刻的预测需要依赖整个序列,包括未来的信息。
312 字
|
2 分钟