Toby Ord 重申 RL 观点:每 FLOP 可学信息上限更低,成就了今天的「参差」能力

tobyordoxford · x · 2026-09-24

哲学家 Toby Ord 在回复 @camhowe1729 时重申其文章观点,未因讨论而改变立场:- RL 的核心限制是每 FLOP 能学到的信息量上限远低于预训练,这引出两个问题——RL 为何仍然有效、以及它能走多远;- 部分答案可能在于 RL 学到的 bits 高度相关;- 他重读旧文后认为其中的预测依然成立,包括 RL 时代 AI 会在被 RL 训练的任务子集上大幅进步、而在其他能力上落后——即现在所说的「jagged(参差的)」智能。

所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →