极端基准 Mazebench 启测:Fable 5.1 将面临百亿级 token 考验
patience_cave · x · 2026-09-02
针对新发布的 Fable 5.1,开发者启动了 Mazebench 测试——这是目前世界上最难的 3D 空间推理基准。
- 测试规模:单次运行可能耗时数周,预计将消耗数十亿 Token。
- 历史表现:Fable 5 在不使用 Python 的情况下得分仅为 1%。
此次测试旨在挑战模型在高维空间推理和长时间任务处理上的极限。
「模型」频道最新
- Fable 5.1 模型集成 Anthropic 统计文本水印 — RaGE_Syria · 2026-09-02
- 多智能体评测缺乏模型间对比,需更多细节 — scaling01 · 2026-09-02
- 评测称 Anthropic Fable 5.1 重回巅峰:代码最强且价格亲民 — danshipper · 2026-09-02
- Fable 5.1 跑分超 GPT-5.6,成本仅六成 — haider1 · 2026-09-02
- 疑 Claude Fable 5.1 增加过多指令,似过度对齐 — teodorio · 2026-09-02
- Anthropic 缓存读价降 75%,仅比 DeepSeek 贵 13 倍 — Teknium · 2026-09-02