RLVR 每 10 倍算力换 3 倍 token 效率,新模型提升疑集中在数学域
tobyordoxford · x · 2026-09-14
牛津大学哲学家 Toby Ord 回复 Ramez Naam:他此前观察到的经验法则是,RLVR(可验证奖励强化学习)的算力每提升 10 倍,达到同等水准所需的 token 数约减少 3 倍(附论文链接)。
Ramez 回应称模型间的跨越式进步相当于 2-3 个数量级的 token 提升,并猜测这个新模型在形式数学上做了大量 RL 训练,认为具体收益可能局限于数学领域,「我们迟早会知道」。两人对最新模型的能力跃升是否具有跨领域泛化性持审慎态度。
所属事件:牛津学者称RLVR算力每增10倍token效率提升约3倍(3 条相关)→
「模型」频道最新
- David Bellamy 澄清实验用的是开源 375B 模型 K2 Horizon — JeremyNguyenPhD · 2026-09-14
- Swift-Qwen3.8-27b 冲上 Hugging Face 热榜,主打高效推理省 token — ukisai · 2026-09-14
- GPT-6 Astra 3D 实测:先作曲再配器,表现力碾压同级竞品 — paw_lean · 2026-09-14
- 被质疑造假后,研究者晒出自己既合成病毒又训过前沿 LLM 的证据 — ethanCaballero · 2026-09-14
- 新模型算力斜率减半:20%到80%需万倍算力,代际跳跃却更大 — tobyordoxford · 2026-09-14
- 复旦 NLP 组论文拆解:为何 max 档 SWE 成绩倒挂 — karminski3 · 2026-09-14