Toby Ord:RL 能规模化到今天,部分答案在中期训练
tobyordoxford · x · 2026-09-24
牛津哲学家 Toby Ord 参与讨论模型能力评估问题:RL 的规模化程度令人意外,且其在非可验证任务上的泛化并没有预期中差;他认为部分解释在于 mid-training(中期训练)。讨论同时提出另一种可能——模型可能只是在学习被测试的内容,导致 benchmark 夸大了整体进展。对话引出 Beren Millidge 的进一步解释。
所属事件:Toby Ord 坚持 RL 信息瓶颈论,与 Millidge 探讨其为何仍有效(5 条相关)→
「模型」频道最新
- 传闻 SSI 将于本月发布首个模型,因安全顾虑曾推迟 — iruletheworldmo · 2026-09-24
- 40B 以下哪些微调模型最擅长模仿写作风格? — Borkato · 2026-09-24
- Opus 5.5 首日口碑:用户称直接取代了 Astra — kimmonismus · 2026-09-24
- 用户盛赞 Anthropic Opus 5.5,Bolt 视频经 4 轮小改即成片 — seanwbren · 2026-09-24
- 开源多模态决策模型 XOR 发布:基于 Qwen,26 万上下文 — TheMoonMidas · 2026-09-24
- 开发者称Grok 4.7与Muse Spark 1.3编码能力已超Opus 4.1和GPT-5 — herbiebradley · 2026-09-24