Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效
牛津哲学家 Toby Ord 在与研究者 Beren Millidge 的多轮公开讨论中,重申了自己关于强化学习(RL)信息效率的核心论点,并对其为何仍然有效给出了补充解释。
已确认
- Millidge 发文指出 LLM RL 存在信息论悖论:预训练对每个 token 计算损失,而策略梯度式 RL 只在长达数十万 token 的 rollout 末尾获得一个常为二值的标量奖励,摊下来每条样本信息量极低(约 1/rollout 长度),却仍能有效训练 LLM。
- 被 Millidge 问及是否更新「RL 没有足够 bits」的看法后,Ord 回应立场基本未变:重读旧文后认为观点依然站得住,其中不少预测已经应验。
- Ord 重申:RL 每单位 FLOP 能学到的信息上限远低于预训练,由此引出「RL 为何有效、能走多远」两个问题。
- Ord 给出的解释包括:可用 bits 虽少但极其相关;RL 能规模化到今天的程度,部分答案在于 mid-training(中期训练);此外 RL 在非可验证任务上的泛化也没有预期中差。
- Ord 同时提出一种质疑:模型可能只是在学习被测试的内容,因此基准或会高估 RL 的真实进展。
为什么重要
- 这一讨论直接触及当前 RL 扩展路线的根本性疑问:如果 RL 的信息效率确实远低于预训练,其能否支撑能力的持续提升存在天花板。
- 「基准可能高估 RL 进展」的假设若成立,将影响对前沿模型真实能力的评估方式,值得关注后续验证。
2026-09-23 ~ 2026-09-24 · 5 条相关
一手来源
- 被问是否改变「RL 没有足够 bits」的看法,Toby Ord 回应立场未变 — tobyordoxford ·
- Toby Ord 补充:RL 或只在学被测内容,基准或高估进展 — tobyordoxford ·
- RL 每条样本只给 1 bit,为何仍能有效训练 LLM? — camhowe1729 ·
- 【源头】RL 每条样本只给 1 bit,为何仍能有效训练 LLM? — camhowe1729 · 2026-09-23
- 【源头】被问是否改变「RL 没有足够 bits」的看法,Toby Ord 回应立场未变 — tobyordoxford · 2026-09-24
- Toby Ord 重申 RL 观点:每 FLOP 可学信息上限更低,成就了今天的「参差」能力 — tobyordoxford · 2026-09-24
- Toby Ord:RL 能规模化到今天,部分答案在中期训练 — tobyordoxford · 2026-09-24
另有 1 条近重复转述:tobyordoxford