GPT-6 Astra 跑 MazeBench 空间推理评测:耗时 60 小时仅得 14%
basedjensen · x · 2026-09-07
博主 patiencecave 用自建评测 MazeBench 测试 GPT-6 Astra:这是一个 3D 开放世界空间推理评测,Astra 在其中运行超过 60 小时,最终得分仅 14%。转发者 Andrew Curran 称这是他比 99% 现有 benchmark 更信任的评测,并指出随着能力进步愈发「锯齿化」,用户往往只看到与自己任务相关的那部分大象。
所属事件:GPT-6 Astra 跑 60 小时 3D 空间评测仅得 14%(7 条相关)→
「模型」频道最新
- GPT-6 Astra 用红石造出可运行的 RGB 显示屏,还自带背景音乐 — Angaisb_ · 2026-09-08
- GPT-6 Astra 睡前一条 prompt 自主挖到钻石,OpenAI 老 RL 老兵感慨 — mcleavey · 2026-09-08
- Claude Fable 5.1 系统提示词解析:从禁用列表到「热修复」式迭代 — dbreunig · 2026-09-08
- Reddit 热议:前沿模型领先本地模型仅约 6 个月 — Anxious_Current2593 · 2026-09-08
- ChatGPT 检索系统泄露:一次提问暗跑 18 条隐藏查询调 50 次引擎 — metehan777 · 2026-09-08
- 用户喊话 Anthropic:Fable 5.1 再好,也想要回正常说话的 Opus — james_mtc · 2026-09-07