GPT Astra 裸跑 MazeBench 仅得 13%,无工具成绩惨淡
Wonderful_Buffalo_32 · reddit · 2026-09-07
Reddit 用户贴出 GPT Astra 在 MazeBench 基准上的评测截图:在不使用任何工具的设置下,模型仅得到 13% 的成绩,迷宫类空间推理任务表现远低于预期。
这与其 demos 中呈现的能力形成明显反差,引发对模型真实空间推理/规划能力的讨论。
所属事件:GPT-6 Astra 实测 MazeBench:空间推理仍卡 3D 难关(7 条相关)→
「模型」频道最新
- Gemini agentic 视频理解默认未开:API 需手动设 processing 为 agentic — patloeber · 2026-09-07
- Gemini 推出 agentic 视频理解:token 省 88%、成本降 66% — patloeber · 2026-09-07
- 业者:真中立评估harness须内嵌原训练工作流才拿得到补贴 — joshalbrecht · 2026-09-07
- Teknium:想跨 harness 表现稳,就用多个 harness 训练 — Teknium · 2026-09-07
- 脚本跑完才知花 2 毛还是 20 美元,开发者吐槽 API 计费黑箱 — Thefounderman1 · 2026-09-07
- HF 上 41 个 OCR 模型分四类整理:覆盖漫画、手写与多语种 — vanstriendaniel · 2026-09-07