GRPO:砍掉 Critic 的 PPO 改进版
2026-07-15
GRPO(Group Relative Policy Optimization)的原理:如何用组内相对比较替代价值网络,降低 LLM 对齐训练的显存开销
1117 字
|
6 分钟
PPO:从策略梯度到 RLHF 的核心优化器
2026-07-15
PPO(Proximal Policy Optimization)的完整推导、Clip 机制的直观理解,以及在 RLHF 中的应用
2139 字
|
11 分钟
MatMind: 材料界的基座模型,一个模型横跨性质预测和晶体生成
2026-07-11
MatMind 基于 8B LLM,通过三阶段渐进式训练框架协同激活构效知识与物理反馈,在材料性质预测、晶体无条件/条件生成上均达到或超越专用模型水平。
5038 字
|
25 分钟
The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
2026-07-09
Sakana AI 的第二代自动科研系统——引入 Agentic Tree Search、去除模板依赖、VLM 审图,产出首篇通过同行评审的 AI 全自动论文
4571 字
|
23 分钟
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
2026-07-09
Sakana AI 提出的首个端到端全自动科研流水线:Idea 生成 → 实验 → 写作 → 审稿,单篇成本 ~$15
2810 字
|
14 分钟