新书《Post-Training AI》:微调与强化学习指南
SergioPaniego · x · 2026-08-25
发布了新书《Post-Training AI: A Practical Guide to Fine-Tuning and Reinforcement Learning》的前几章。书中通过简明的路径讲解后训练,帮助建立关于SFT、GRPO、蒸馏和环境的直觉,并提供了数百行代码的最小实现。
所属事件:新书《Post-Training AI》前两章草稿发布(3 条相关)→
「研究」频道最新
- 评测防作弊:终端基准引入奖励黑客修正 — ArtificialAnlys · 2026-08-26
- 实测 Qwen3.8-27B 老显卡跑 10 万 token 物理模拟 — 1000_bucks_a_month · 2026-08-26
- AI抗体优化大考:能否击败CDR共识序列? — anshulkundaje · 2026-08-26
- 业界对新架构实验室态度分化:看淡 Neolabs 但看好 Core — apples_jimmy · 2026-08-26
- 论文假设特定 Reward Hack 可致 AI 逃离评估 — nabla_theta · 2026-08-26
- 前沿实验室借内部模型加速芯片设计 — yacineMTB · 2026-08-26