Toby Ord 补充:RL 或只在学被测内容,基准或高估进展

tobyordoxford · x · 2026-09-24

在回应 Beren Millidge 新文时,Toby Ord 重申其对 RL 的核心观点:RL 每单位 FLOP 能学到的信息上限远低于预训练,这引出「它为何有效、能走多远」的疑问。他补充一种可能的解释——bits 虽少但极其相关,以及 RL 可能只在学习被测试的内容,因此基准测试可能误代表了整体能力进展。

他表示很高兴看到 Millidge 对这些问题给出更深入的解释。

所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →