新书发布:SFT、GRPO 与蒸馏的后训练实践指南
Hesamation · x · 2026-08-26
一本名为《Post-Training AI》的新书发布了前几章预览。该书旨在提供一条简洁的路径,帮助读者建立关于 SFT(监督微调)、GRPO、知识蒸馏和环境训练中 Agent 学习的直觉。目前书籍内容正在持续更新中。
所属事件:新书《Post-Training AI》前两章草稿发布(3 条相关)→
「研究」频道最新
- 创意基准测试展示:如何用怪诞想法评估模型 — mariofilhoml · 2026-08-26
- Rasyn Lab 发布 350M 参数逆合成模型 Synthon — ycombinator · 2026-08-26
- 研究称 LLM 上下文学习能力源自预训练特定数据 — JoshPurtell · 2026-08-26
- 化学家用 AI 证明 RNA 可设计性定理,Lean 形式化验证后发布 arXiv — rbhar90 · 2026-08-26
- AI 智能体协助数学研究:一次对话即完成群论证明 — Sauers_ · 2026-08-26
- 通过强化学习教 Qwen 3.5 用 JavaScript 代码画水彩画 — ycombinator · 2026-08-26