Fable 5 在 FrogsGame 上跑到 34% pass@1
aronchick · x · 2026-07-21
引用帖里提到,Fable 5 在 FrogsGame 的 post-training 任务上表现异常突出。
- 它先训练一个更弱的模型去解谜,在某个阶段峰值达到 68%,也是整个基准里唯一看到的约 10x 提升。
- 这次训练耗时 17 小时、消耗 2500 万 token,全程没有人工介入。
- 最终报告的成绩是 34% pass@1,而其他前沿模型平均都在 4% 以下。
- 作者还拿《瑞克和莫蒂》里“套娃式创建更深宇宙干活”的桥段来调侃这种训练方式。
「Fun」频道最新
- “香料必须流动”被拿来调侃最便宜推理胜出 — markjeffrey · 2026-07-22
- GPT-5.6 Sol成功从头创建macOS Sequoia Hackintosh — pvncher · 2026-07-22
- 临时自定义指令让 ChatGPT 选了 Jacobian 猜想 — flowersslop · 2026-07-22
- 拼接 Claude 和 Grok 额度重置的 AI 梗图 — djcows · 2026-07-22
- 一个 SymPy 段子,把模型工具调用玩成神经符号架构梗 — thomasahle · 2026-07-22
- AI 应用一接进 Slack 就失控的梗图 — generativist · 2026-07-22