RLVR 每 10 倍算力换 3 倍 token 效率,新模型提升疑集中在数学域

tobyordoxford · x · 2026-09-14

牛津大学哲学家 Toby Ord 回复 Ramez Naam:他此前观察到的经验法则是,RLVR(可验证奖励强化学习)的算力每提升 10 倍,达到同等水准所需的 token 数约减少 3 倍(附论文链接)。

Ramez 回应称模型间的跨越式进步相当于 2-3 个数量级的 token 提升,并猜测这个新模型在形式数学上做了大量 RL 训练,认为具体收益可能局限于数学领域,「我们迟早会知道」。两人对最新模型的能力跃升是否具有跨领域泛化性持审慎态度。

所属事件:牛津学者称RLVR算力每增10倍token效率提升约3倍(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →