Toby Ord 重申 RL 观点:每 FLOP 可学信息上限更低,成就了今天的「参差」能力
tobyordoxford · x · 2026-09-24
哲学家 Toby Ord 在回复 @camhowe1729 时重申其文章观点,未因讨论而改变立场:- RL 的核心限制是每 FLOP 能学到的信息量上限远低于预训练,这引出两个问题——RL 为何仍然有效、以及它能走多远;- 部分答案可能在于 RL 学到的 bits 高度相关;- 他重读旧文后认为其中的预测依然成立,包括 RL 时代 AI 会在被 RL 训练的任务子集上大幅进步、而在其他能力上落后——即现在所说的「jagged(参差的)」智能。
所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→
「漫话AGI」频道最新
- Musk 谈 Neuralink:人类输出仅 100 比特/秒,AI 达万亿级 — XFreeze · 2026-09-24
- Noam Brown 对谈 Dwarkesh:当 AI 学会撒谎会发生什么 — Dwarkesh Patel · 2026-09-24
- 46 家 AI 收购整合平台仅 2 家获 A,Vista 与 Apollo 领跑 — curious_vii · 2026-09-24
- Dario Amodei 表态:Anthropic 将“必要时尽可能放慢”确保 AI 安全 — Polymarket · 2026-09-24
- AI 专家 Linthicum:对 OpenAI 事故的末日论是过度反应 — DavidLinthicum · 2026-09-24
- Altman 在联合国发言:拒绝盲目乐观也不当末日论者 — ns123abc · 2026-09-24