RL 数据放进预训练会怎样?DeepMind 研究员论 LLM 本质
burny_tech · x · 2026-09-27
DeepMind 研究员 Tomasz Korbak 与圣塔菲研究所的 Melanie Mitchell 就「RL 后训练是否改变了语言建模范式」展开辩论。Korbak 认为:即使加入 RL rollout 数据,模型仍是在建模语言——只是分布略有不同,固定数据下架构与目标函数基本不变;若把 RL rollouts 直接加进预训练数据,效果不会有本质差别。
他还指出,经典的「随机鹦鹉」论文并未对「哪种训练分布才算语言建模」做此区分,其批评针对的是整个预测下一个 token 的范式。这是对「RL 后训练是否让 LLM 超越语言建模」这一核心问题的清晰表述。
「模型」频道最新
- 网友展示 Opus 5.5 十五分钟完成复杂任务 — gaganghotra_ · 2026-09-27
- ROME 论文揭秘:GPT 的事实知识藏在 MLP 权重里,可精准编辑 — burny_tech · 2026-09-27
- JevBench 研究者做客 ThursdAI 播客,谈 Jev 类模型(2:01 起) — airesearch12 · 2026-09-27
- 黑客松冠军:4000 次 Jev 判断只花 1.3 美元的生态模拟 — schwentker · 2026-09-27
- Jev 用合成数据长成 System 1 模型,图像输入在路线图上 — schwentker · 2026-09-27
- Jev 定价实测:720 状态 × 30 问题成本不到 10 美分 — schwentker · 2026-09-27