极端基准 Mazebench 启测:Fable 5.1 将面临百亿级 token 考验
patience_cave · x · 2026-09-02
针对新发布的 Fable 5.1,开发者启动了 Mazebench 测试——这是目前世界上最难的 3D 空间推理基准。
- 测试规模:单次运行可能耗时数周,预计将消耗数十亿 Token。
- 历史表现:Fable 5 在不使用 Python 的情况下得分仅为 1%。
此次测试旨在挑战模型在高维空间推理和长时间任务处理上的极限。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- 前沿大厂隐私条款暗藏陷阱:点个赞你的对话就可能不被保护 — niloofar_mire · 2026-09-12
- GPT-6 Astra 自建引擎下棋,测得 ELO 约 1800-2000 无人能胜 — MikePFrank · 2026-09-12
- Cursor 推出 CursorBench 4.0,有人据此猜测 Gemini 3.8 后训练路线不同 — ivan_bezdomny · 2026-09-12
- 32GB 显存跑 Qwen3.8 27B:动态配置让上下文从 17 万扩到 26 万 token — wadeAlexC · 2026-09-12
- OpenAI 请用户用 /feedback 提交 Astra 异常样本,修复赶在 6.1 发布前 — ivan_bezdomny · 2026-09-12
- 开发者谈 Astra:别当升级版编码模型,当个难搞的天才用 — kevinkern · 2026-09-12