Olmo 3 讲座拆解 DPO、数据难题与研究落地
natolambert · x · 2026-07-29
Olmo 3 后训练与 DPO 讲座:研究想法如何落地到近前沿模型
Nathan Lambert 介绍了一期和 Scott Geng 的播客/讲座,主题是 Olmo 3 的后训练流程与 DPO 实践。内容不只是算法本身,更强调研究落地时的各种脏活累活。
- 研究想法如何进入近前沿模型
- DPO 最麻烦的地方往往是数据,而不是公式
- 多阶段后训练配方里的组织与协作问题
- 对 DPO 现状和未来研究方向的反思
- 也回顾了 DPO 基础和相关算法谱系
所属事件:Olmo 3 讲座探讨后训练流程与 DPO 技术落地(2 条相关)→
「模型」频道最新
- Zvi设赌局:Opus 5能否在Spires基准上击败Sol? — TheZvi · 2026-07-30
- Gemini 3.5 Flash 和 3.6 Flash 视觉推理表现亮眼 — rseroter · 2026-07-30
- LLM 文明游戏实测:Claude 与 GPT 自发结盟,拒绝互相攻击 — wightmanr · 2026-07-30
- 终端工具 Warp 集成 Kimi K3,称其任务完成度领跑开源模型 — vikvang1 · 2026-07-30
- Kimi K3 架构解析:KV Cache 卸载与常量状态细节 — zephyr_z9 · 2026-07-29
- Gemini 3.5 Flash 只挪一根管子就解出视觉排序题 — iamrobotbear · 2026-07-29