CNN-BatchNorm
2026-06-28
这一部分单独拿出来讲讲,因为后面和 Transformer 的 Layer Normalization 有些类似。
248 字
|
1 分钟
GAN-介绍
2026-06-28
是一种深度学习模型,由 Ian Goodfellow 等人在 2014 年提出。GAN 的核心思想是通过两个神经网络的对抗训练来生成逼真的数据样本。
291 字
|
1 分钟
Trasformer-编码器的其他部分:Add&Norm
2026-06-28
Add: 指残差连接(Residual Connection),也叫跳跃连接(Skip Connection)
1073 字
|
5 分钟
Trasformer-OtherPartsInEncoder-FFN
2026-06-28
这里讲解码器的前馈网络(Feed Forward Network,FFN),它是 Transformer 编码器和解码器中每个子层的一个重要组成部分。也是 Transformer block 中的第二个子层(第一个子层是多头注意力)。
641 字
|
3 分钟
Trasformer-ViT视觉Transformer
2026-06-28
其实Vit 的问题就是如何让transformer像处理 NLP 任务一样处理图像任务。ViT的输入是图像,输出是分类结果。ViT的核心思想就是把图像切成小块(patch),然后把这些小块当作一个序列输入到transformer中进行处理。这里重点讲编码的过程。
1351 字
|
7 分钟
Trasformer-编码器核心:self-attention自注意力机制
2026-06-27
Transformer的架构由编码器(Encoder) 和解码器(Decoder) 两大部分组成
1453 字
|
7 分钟
Trasformer-编码器的其他部分:位置编码
2026-06-27
positional encoding位置编码、残差连接、层归一化、前馈神经网络
2511 字
|
13 分钟
视觉先验-在神经网络结构中的体现
2026-06-26
在上一节中,我们讨论了如何把先验“塞进”损失函数(通过额外惩罚项)。但这一节要讲一个更深刻、更“偷懒”的思想:如果我把网络结构本身设计成某种样子,是不是连损失函数里的惩罚项都可以省了?
1375 字
|
7 分钟