全局词向量与子词嵌入:GloVe、fastText 与 BPE
2026-07-18
从全局共现统计到子词切分:GloVe 的加权最小二乘、fastText 的 n-gram 表示、BPE 的分词算法
2072 字
|
10 分钟
从 word2vec 到 LLM:NLP 表示学习演进路线
2026-07-18
梳理词嵌入、预训练范式与语言模型的发展脉络,建立 NLP 知识体系与 minimind 训练流程的对应关系
1341 字
|
7 分钟
GRPO:砍掉 Critic 的 PPO 改进版
2026-07-15
GRPO(Group Relative Policy Optimization)的原理:如何用组内相对比较替代价值网络,降低 LLM 对齐训练的显存开销
1117 字
|
6 分钟
PPO:从策略梯度到 RLHF 的核心优化器
2026-07-15
PPO(Proximal Policy Optimization)的完整推导、Clip 机制的直观理解,以及在 RLHF 中的应用
2139 字
|
11 分钟