OLMo 作者称 RLHF 新书已写完
giffmana · x · 2026-07-23
OLMo 作者说他的 RLHF 书写完了
被引用的原帖宣布,作者的新书 《Reinforcement Learning from Human Feedback》 已经完成。
他把这本书描述成自己在学习微调、对齐,以及在 ChatGPT 之后做 post-training 时最希望能拥有的资料;整本书是作者从 2024 年起利用夜晚和周末一点点写出来的,并尽量把 OLMo 项目中的实践直觉整理进书里。
这条回复本身只是恭喜,但真正的信息量在于这本 RLHF 书籍已经正式完成并准备发布。
所属事件:Nat Lambert 宣布 RLHF 新书完稿,附超 10 小时课程(11 条相关)→
「公司和人」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 前 OpenAI/Anthropic 研究员辞职,批两巨头正赌命冲向自我改进超智 — davidmanheim · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- Anthropic 研究员被指暗中窥探学术客户研究、抢先出成果引争议 — basedjensen · 2026-09-11
- 投资人放话:Palantir×英伟达联手将重创 Anthropic IPO 估值 — pdamodaran · 2026-09-11