RLHF 新书完稿,作者称从 2024 年起用晚间和周末写成

vjkaruna · x · 2026-07-22

作者宣布自己的书 《Reinforcement Learning from Human Feedback》 已经完成,即将上市。

他表示,这本书是自己在学习如何对模型进行 fine-tune、对齐和 post-train 时最希望当时就能有的资料;书稿从 2024 年起主要利用晚上和周末时间完成,并尽量把自己在构建 Olmo 时积累的直觉整理成书。

所属事件:Nat Lambert 宣布 RLHF 新书完稿,附超 10 小时课程(11 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →