Nat Lambert 完成一本从 2024 年写到现在的 RLHF 图书

danielhanchen · x · 2026-07-22

Nat Lambert 宣布他写的《Reinforcement Learning from Human Feedback》已经完成,并说这本书是他自己在学习微调、对齐和后训练时“最希望当时就有”的参考资料。<br><br>他提到,这本书主要是在 2024 年以来利用晚上和周末时间整理完成,内容尽量把他在 Olmo 相关工作里积累的直觉和经验转成书面知识。

所属事件:Nat Lambert 宣布 RLHF 新书完稿,附超 10 小时课程(11 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →