Toby Ord:RL 能规模化到今天,部分答案在中期训练

tobyordoxford · x · 2026-09-24

牛津哲学家 Toby Ord 参与讨论模型能力评估问题:RL 的规模化程度令人意外,且其在非可验证任务上的泛化并没有预期中差;他认为部分解释在于 mid-training(中期训练)。讨论同时提出另一种可能——模型可能只是在学习被测试的内容,导致 benchmark 夸大了整体进展。对话引出 Beren Millidge 的进一步解释。

所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →