ramez:代际跳跃值两三个数量级token,猜测新模型重RL数学

ramez · x · 2026-09-14

ramez 回应 tobyordoxford 对扩展曲线的分析:他认为「更差的斜率」确实有趣,而代际间的巨大跳跃足以「支付」2-3 个数量级的 token 消耗。他猜测该模型可能在形式数学上做了大量 RL 训练,导致收益高度偏向数学领域,表示最终会揭晓。核心观点:代际基线提升可以抵消推理扩展斜率变差的损失。

所属事件:Toby Ord 解析新推理扩展曲线:斜率减半但代际跳跃巨大(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →