牛津学者称RLVR算力每增10倍token效率提升约3倍
牛津大学哲学家 Toby Ord 与 Ramez Naam 讨论推理扩展曲线时提出经验法则:RLVR(可验证奖励强化学习)算力每提升 10 倍,达到同等水准所需 token 约减少三分之二,即换得约 3 倍 token 效率。他估算新模型的能力跳跃相当于旧模型多消耗 100 倍 token,约为四个世代的进步,且疑集中于数学领域。他还猜测斜率减半可能源于新数据集题目难度方差更大,但对数级推理扩展的基本规律依然成立。
2026-09-14 ~ 2026-09-14 · 3 条相关
- RLVR 每 10 倍算力换 3 倍 token 效率,新模型提升疑集中在数学域 — tobyordoxford · 2026-09-14
- 新代际提升等效旧模型多用100倍token,相当于四个世代的跳跃 — tobyordoxford · 2026-09-14
- 斜率减半或因新数据集难度方差更大,对数扩展依然成立 — tobyordoxford · 2026-09-14