MazeBench 实测:模型推理 4 亿 token、24 小时仅得 23 分
mhmazur · x · 2026-09-14
MazeBench 作者发布对 GPT-6 Astra 的 3D 迷宫环境实测:消耗 4 亿 token、推理 24 小时后最终得分仅 23%;而不用 Python 工具时得分只有 14%,说明代码工具对该模型在此类空间推理任务上提升显著。mhmazur 等人对该基准与分析表示赞赏。
所属事件:MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理(6 条相关)→
「模型」频道最新
- Sewon Min:自建 agent harness 能大幅降本,现成框架溢价过高 — omarsar0 · 2026-09-15
- Agent Arena 榜单:DeepSeek V4.1 Flash 以 $0.06/任务挤进 Pareto 前沿 — arena · 2026-09-15
- 23 天没开 Claude Code:博主称 Codex 配开源模型更顺手 — Yuchenj_UW · 2026-09-15
- 深度估计模型 Marigold-V2 冲上 Hugging Face 热榜 — toshas · 2026-09-15
- 曝 OpenAI 雇数百合同工人工审读 ChatGPT 对话 — The Decoder · 2026-09-15
- Hugging Face 团队梳理:哪些开源 LLM 最适合端侧推理 — NielsRogge · 2026-09-15