RL 数据放进预训练会怎样?DeepMind 研究员论 LLM 本质

burny_tech · x · 2026-09-27

DeepMind 研究员 Tomasz Korbak 与圣塔菲研究所的 Melanie Mitchell 就「RL 后训练是否改变了语言建模范式」展开辩论。Korbak 认为:即使加入 RL rollout 数据,模型仍是在建模语言——只是分布略有不同,固定数据下架构与目标函数基本不变;若把 RL rollouts 直接加进预训练数据,效果不会有本质差别。

他还指出,经典的「随机鹦鹉」论文并未对「哪种训练分布才算语言建模」做此区分,其批评针对的是整个预测下一个 token 的范式。这是对「RL 后训练是否让 LLM 超越语言建模」这一核心问题的清晰表述。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →