牛津学者称RLVR算力每增10倍token效率提升约3倍

牛津大学哲学家 Toby Ord 与 Ramez Naam 讨论推理扩展曲线时提出经验法则:RLVR(可验证奖励强化学习)算力每提升 10 倍,达到同等水准所需 token 约减少三分之二,即换得约 3 倍 token 效率。他估算新模型的能力跳跃相当于旧模型多消耗 100 倍 token,约为四个世代的进步,且疑集中于数学领域。他还猜测斜率减半可能源于新数据集题目难度方差更大,但对数级推理扩展的基本规律依然成立。

2026-09-14 ~ 2026-09-14 · 3 条相关