rasbt 从零实现推理模型第 6 课:手把手讲解并实现 RLVR 与 GRPO
rasbt · x · 2026-10-03
Sebastian Raschka 的「Reasoning from scratch」系列更新到第 6 轮,完整讲解并从零实现 RLVR(可验证奖励强化学习)与 GRPO(Group Relative Policy Optimization)。
内容分理论与实操两部分:
- 理论:推理模型与普通模型的区别、推理链与模型能力、准确性/格式奖励的设计、DeepSeek-R1 的 "aha moment"、RLHF 与 RLVR 的区别、GRPO 相对 PPO 的改进(含烹饪类比)及 KL 项与简化版 GRPO。
- 实操:加载预训练模型与 MATH 训练数据、采样响应、计算可验证奖励与优势、实现 token/序列对数概率、GRPO 损失与完整训练循环、训练设置与 checkpoint、最后在 MATH-500 上评估结果,并讨论训练稳定性与显存需求。
视频附完整时间戳目录,可当教程直接跟做。
所属事件:rasbt 从零实现 RLVR 与 GRPO 教程上线(2 条相关)→
「编程与Agent」频道最新
- OpenAI DevDay:Dot 智能体配专属云电脑与浏览器,由 GPT-6 Astra 驱动 — dl_weekly · 2026-10-03
- 392 个子智能体烧 40 亿 token 跑 26 小时,自建出 Ableton 替代品 — chrisfirst · 2026-10-03
- Altman 播客谈 Dot 替他值守早晨,并力推跨应用携带订阅 — every · 2026-10-03
- CoreWeave 发布 Forge 平台:打通 agent 运行、追踪、评测到强化学习全流程 — _ScottCondron · 2026-10-03
- Claude Opus 5.5 与 Sonnet 5.5 已登陆 Google Antigravity — algo_diver · 2026-10-03
- OpenAI 云端电脑 Dots 上手:统一管理本地 Codex 项目会话 — vista8 · 2026-10-03