AI 读书会九月共读 RLHF,作者将在结束后参与讨论
sophiamyang · x · 2026-09-02
AI Book Club 九月份的阅读书目是 @natolambert 所著的《Reinforcement Learning from Human Feedback》。该书适合从事模型后训练工作的开发者,覆盖指令微调、奖励模型、PPO 与 DPO 对比、偏好数据以及鲜少公开的失败模式。读书会每月读一本 AI 书籍,在 Discord 讨论,并在结束后邀请作者进行交流。
「公司和人」频道最新
- MIT 评 Hacking Face 事件:揭示 OpenAI 文化隐患 — DavidSKrueger · 2026-09-02
- 我微调了一个 511M 参数的 Rust 代码模型 — StormworksVirtualAir · 2026-09-02
- 为何企业倾向使用模型集成:场景与成本权衡 — brucemacv · 2026-09-02
- WebMCP Challenge 开发者挑战赛剩 48 小时截稿 — OpenAIDevs · 2026-09-02
- 开发者算账:Fable 5.1 降价能让总成本降 57% — _thispageleftblank · 2026-09-02
- Shopify 0.8B 微调模型击败 GPT — PyTorch · 2026-09-02