ramez:代际跳跃值两三个数量级token,猜测新模型重RL数学
ramez · x · 2026-09-14
ramez 回应 tobyordoxford 对扩展曲线的分析:他认为「更差的斜率」确实有趣,而代际间的巨大跳跃足以「支付」2-3 个数量级的 token 消耗。他猜测该模型可能在形式数学上做了大量 RL 训练,导致收益高度偏向数学领域,表示最终会揭晓。核心观点:代际基线提升可以抵消推理扩展斜率变差的损失。
所属事件:Toby Ord 解析新推理扩展曲线:斜率减半但代际跳跃巨大(5 条相关)→
「模型」频道最新
- 评论人称 Anthropic 炼书训练致百万书籍原文失传 — StewartalsopIII · 2026-09-14
- 书生发布 397B 开源模型 Intern-S2,多模态与 Agent 能力加持,vLLM 零日支持 — Nunki08 · 2026-09-14
- 圈内人实测:DeepSeek V4.1 基准偏低但速度快 4 倍 — teortaxesTex · 2026-09-14
- 4GB 显存求推荐:擅长写作的小型本地 LLM 怎么选 — Mysterious-Comment94 · 2026-09-14
- X 网友称传阅的 Astra/Fable 参数远小于 10 万亿,模型规模已难对应能力 — teortaxesTex · 2026-09-14
- 记者实测:免费 ChatGPT 花 13 分钟破解十年悬而未决的骰子难题 — Chris_Armstrong · 2026-09-14