MiniMind 数据侧:Tokenizer 与三阶段数据处理
从 6400 词表的构成讲起,再分别拆解 Pre-training、SFT、DPO 三个阶段如何把原始 jsonl 变成模型可以吃下的张量
通过 RSS 订阅,第一时间获取最新文章和动态
复制链接到你的 RSS 阅读器
https://biscuit0613.github.io/rss.xml
从 6400 词表的构成讲起,再分别拆解 Pre-training、SFT、DPO 三个阶段如何把原始 jsonl 变成模型可以吃下的张量
使用宠物问答数据对 MiniMind 64M 模型进行 LoRA 微调,并通过前后样例分析领域适配中的能力退化
汇总 MiniMind 项目的学习路径、代码注释、三阶段训练实践、成果链接与当前局限,作为科研实习申请材料入口
在 A100-80GB 上完成 MiniMind 的三阶段训练(Pre-training → SFT → DPO),详细记录每阶段的参数配置、训练日志、loss 曲线与权重文件
沿着 MiniMind 的 Attention.forward,将 Q/K/V 投影、QK Norm、RoPE、GQA、KV Cache、因果掩码与缩放点积注意力逐段翻译为数学公式和张量形状
沿着 MiniMind 的一次前向传播,将模型配置、Embedding、Decoder Block、LM Head 与错位交叉熵逐段翻译为数学公式和张量形状
RSS(Really Simple Syndication)是一种用于发布经常更新内容的标准格式。通过 RSS,你可以:
推荐使用 Feedly、Inoreader 或其他 RSS 阅读器来订阅本站。