MazeBench 新结果:Gemini 3.8 Flash 仅得 4%,模型普遍低于 1%
patience_cave · x · 2026-09-04
patiencecave 公布 MazeBench(3D 开放世界迷宫基准)最新结果:Gemini 3.8 Flash 得 4%,Muse Spark 1.3 得 0%,Fable 5.1 仍在跑,目前与 Fable 5 持平。
关键结论:在没有代码执行能力的情况下,模型在该环境中得分都低于 1%。后续补充:GPT-5.6 Sol 目前居首(跑得更久且更便宜);Fable 5.1 已到 10%,若保持速度可能登顶;Google 的 Flash 系列两个月内从 0% 到 1% 再到 4%,热力图对比显示每代 agent 的世界建模精度都在提升。
「模型」频道最新
- Muse Spark 1.3 实测:16K 体素 3D 场景 30+fps,逼近 GLM-5.3 与 GPT-5.6 Sol — cedric_chee · 2026-09-05
- Qwen3.8-27b 成他首个敢盲跑的本地模型:连续 Agent 工作 8 小时零失误 — Express_Quail_1493 · 2026-09-04
- GLM 推出四项免费活动:编码计划不限量、周末送 4 亿 token — Zai_org · 2026-09-04
- Muse Spark 1.3 三维体素场景实测:性能紧追 GLM-5.3 与 GPT-5.6 — cedric_chee · 2026-09-04
- 实测发现:设 reasoning effort 为 none,压缩上下文仍消耗推理 token — mhmazur · 2026-09-04
- 爆料讨论:OpenAI 或用合成 CoT 改写内化推理链 — cephaloform · 2026-09-04