MiniMind 数据侧:Tokenizer 与三阶段数据处理
从 6400 词表的构成讲起,再分别拆解 Pre-training、SFT、DPO 三个阶段如何把原始 jsonl 变成模型可以吃下的张量
3635 字
|
18 分钟
MiniMind 训练实战 (四)LoRA 微调与推理部署
使用宠物问答数据对 MiniMind 64M 模型进行 LoRA 微调,并通过前后样例分析领域适配中的能力退化
318 字
|
2 分钟
MiniMind 学习成果总览:从源码阅读到 Pre-training、SFT 与 DPO
汇总 MiniMind 项目的学习路径、代码注释、三阶段训练实践、成果链接与当前局限,作为科研实习申请材料入口
427 字
|
2 分钟
MiniMind 训练实战:从预训练到偏好对齐的全流程记录
在 A100-80GB 上完成 MiniMind 的三阶段训练(Pre-training → SFT → DPO),详细记录每阶段的参数配置、训练日志、loss 曲线与权重文件
1377 字
|
7 分钟
MiniMind 代码导读(二):Attention 的完整张量流
沿着 MiniMind 的 Attention.forward,将 Q/K/V 投影、QK Norm、RoPE、GQA、KV Cache、因果掩码与缩放点积注意力逐段翻译为数学公式和张量形状
3815 字
|
19 分钟
MiniMind 代码导读(一):从 Token IDs 到训练 Loss
沿着 MiniMind 的一次前向传播,将模型配置、Embedding、Decoder Block、LM Head 与错位交叉熵逐段翻译为数学公式和张量形状
3431 字
|
17 分钟
词嵌入基础:word2vec
从 one-hot 到分布式表示:Skip-gram、CBOW、负采样与层次 Softmax 的完整推导
9794 字
|
49 分钟
BERT:预训练+微调范式
从双向上下文建模到 MLM/NSP 预训练任务:BERT 如何用 Transformer 编码器统一 NLU 任务
2216 字
|
11 分钟