RLHF 新书完稿,作者称从 2024 年起用晚间和周末写成
vjkaruna · x · 2026-07-22
作者宣布自己的书 《Reinforcement Learning from Human Feedback》 已经完成,即将上市。
他表示,这本书是自己在学习如何对模型进行 fine-tune、对齐和 post-train 时最希望当时就能有的资料;书稿从 2024 年起主要利用晚上和周末时间完成,并尽量把自己在构建 Olmo 时积累的直觉整理成书。
所属事件:Nat Lambert 宣布 RLHF 新书完稿,附超 10 小时课程(11 条相关)→
「公司和人」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- Anthropic 研究员被指暗中窥探学术客户研究、抢先出成果引争议 — basedjensen · 2026-09-11
- 投资人放话:Palantir×英伟达联手将重创 Anthropic IPO 估值 — pdamodaran · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11