MazeBench 新榜:Grok 探索最多,Gemini 解题最强
patience_cave · x · 2026-08-25
MazeBench 编码 Agent 新一轮评测结果公布:
- Grok 4.6:探索了最多的房间(6 个),但解决谜题得分为 0%。
- Gemini 3.7 Flash:得分 1%,是唯一解决谜题(收集宝石)的模型,表现优于 Kimi K3。
- 其他模型:ox-alpha、glm、qwen 得分均为 0%。
行为观察:
- ox-alpha、glm 和 qwen 在遇到“T 型”积木和“T 型”孔洞时遇到困难,它们未能将积木推入孔洞中。
所属事件:MazeBench 新榜:多数旗舰模型迷宫任务得零分(3 条相关)→
「编程与Agent」频道最新
- Offloop:让 AI Agent 在团队群聊中无缝协作 — aliscodes · 2026-08-25
- Harbor 招聘:预计今年处理 10 亿美元 Token 支出 — DimitrisPapail · 2026-08-25
- Steve Yegge 漫画讽刺 Agent 告警失灵:五个小时没人被叫醒 — Steve_Yegge · 2026-08-25
- 60 秒速览 W&B Weave 五项新特性:Signals、会话与轮次等 — wandb · 2026-08-25
- GitHub 风格 PR 工作流无法适配 AI 智能体时代 — mattrickard · 2026-08-25
- Apodex 引入任务编排机制,多 Subagent 并行处理 — huangyun_122 · 2026-08-25