MazeBench 新结果:Gemini 3.8 Flash 仅得 4%,模型普遍低于 1%

patience_cave · x · 2026-09-04

patiencecave 公布 MazeBench(3D 开放世界迷宫基准)最新结果:Gemini 3.8 Flash 得 4%,Muse Spark 1.3 得 0%,Fable 5.1 仍在跑,目前与 Fable 5 持平。

关键结论:在没有代码执行能力的情况下,模型在该环境中得分都低于 1%。后续补充:GPT-5.6 Sol 目前居首(跑得更久且更便宜);Fable 5.1 已到 10%,若保持速度可能登顶;Google 的 Flash 系列两个月内从 0% 到 1% 再到 4%,热力图对比显示每代 agent 的世界建模精度都在提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →