Toby Ord 补充:RL 或只在学被测内容,基准或高估进展
tobyordoxford · x · 2026-09-24
在回应 Beren Millidge 新文时,Toby Ord 重申其对 RL 的核心观点:RL 每单位 FLOP 能学到的信息上限远低于预训练,这引出「它为何有效、能走多远」的疑问。他补充一种可能的解释——bits 虽少但极其相关,以及 RL 可能只在学习被测试的内容,因此基准测试可能误代表了整体能力进展。
他表示很高兴看到 Millidge 对这些问题给出更深入的解释。
所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→
「漫话AGI」频道最新
- OpenAI 研究员 Boaz Barak:宁要人类掌舵,也不要仁慈的 AI 独裁者 — tszzl · 2026-09-24
- CNAS 发布 AGI 情景谱系报告:如何影响 AGI 未来走向 — paul_scharre · 2026-09-24
- 哲学家 Veliz:AI 主导并非定局,「未来不是被预测的,是被制造的」 — CarissaVeliz · 2026-09-24
- Karpathy 11 个月态度转变:从发明 vibe coding 到自叹大幅落后 — IgorCarron · 2026-09-24
- 塔勒布:擅长 IQ 测试但缺想象力的人正被 AI 取代 — intellectronica · 2026-09-24
- Gary Marcus 转发质疑:Dario 的「AI 驱动生物发现」经不起博士答辩 — GaryMarcus · 2026-09-24