GPT-6 不用代码执行(14%)仍胜过带 Python 的 GPT-5.6(13%)
patience_cave · x · 2026-09-07
MazeBench 线程总结:GPT-6 Astra 在不使用代码执行的条件下得 14%,高于带 Python 代码执行的 GPT-5.6 Sol 的 13%,说明能力代际跃升。但即便如此,距离通过 MazeBench 更难的挑战仍有很大差距。链接附 MazeBench 排行榜页面。
所属事件:GPT-6 Astra 创 MazeBench 最高分但仍卡在 3D 空间推理(5 条相关)→
「模型」频道最新
- 18 个月内智能单价暴跌约 1000 倍,新模型还更聪明 — ccerrato147 · 2026-09-07
- 博主称 Google Astra 说话不装腔,替代了最后一点 Claude 依赖 — StewartalsopIII · 2026-09-07
- 投资人讽前沿实验室订阅模式:高档模型用量将逐步紧缩 — StewartalsopIII · 2026-09-07
- GPT Astra 裸跑 MazeBench 仅得 13%,无工具成绩惨淡 — Wonderful_Buffalo_32 · 2026-09-07
- GPT-6 Astra 一步生成精美数学动画,作者直呼前所未见 — omarsar0 · 2026-09-07
- giffmana 与 NandoDF 交锋:LLM 至今做不好实验设计 — giffmana · 2026-09-07