OLMo 作者称 RLHF 新书已写完
giffmana · x · 2026-07-23
OLMo 作者说他的 RLHF 书写完了
被引用的原帖宣布,作者的新书 《Reinforcement Learning from Human Feedback》 已经完成。
他把这本书描述成自己在学习微调、对齐,以及在 ChatGPT 之后做 post-training 时最希望能拥有的资料;整本书是作者从 2024 年起利用夜晚和周末一点点写出来的,并尽量把 OLMo 项目中的实践直觉整理进书里。
这条回复本身只是恭喜,但真正的信息量在于这本 RLHF 书籍已经正式完成并准备发布。
所属事件:Nat Lambert 完成 RLHF 新书(11 条相关)→
「公司和人」频道最新
- Andera 获 Lightspeed 领投 3700 万美元 A 轮 — Jackyhuang · 2026-07-23
- Thrive Holdings 招人把前沿 AI 落到收购的中小企业里 — samaysham · 2026-07-23
- Octane 加入 OpenAI 的 Cyber 受信访问计划 — thedealdirector · 2026-07-23
- AI经济研究员Clay加入智库Windfall Trust — luke_drago_ · 2026-07-23
- Shopify 联手 Vercel,把应用和 Agent 基建带给数百万商家 — evilrabbit_ · 2026-07-23
- Multica 说社区 PR 审核成本极高,仍有 400+ 未合并 — jiayuan_jy · 2026-07-23