GPT-6 不用代码执行(14%)仍胜过带 Python 的 GPT-5.6(13%)

patience_cave · x · 2026-09-07

MazeBench 线程总结:GPT-6 Astra 在不使用代码执行的条件下得 14%,高于带 Python 代码执行的 GPT-5.6 Sol 的 13%,说明能力代际跃升。但即便如此,距离通过 MazeBench 更难的挑战仍有很大差距。链接附 MazeBench 排行榜页面。

所属事件:GPT-6 Astra 创 MazeBench 最高分但仍卡在 3D 空间推理(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →