GPT-6 Astra 带代码执行解 3D 关卡,规划时间从 20 分钟缩到 5 分钟内
patience_cave · x · 2026-09-14
patiencecave 重复发布 Astra MazeBench 测试数据:GPT-6 Astra + Python 在 4 亿 token、24 小时推理后得 23%,无 Python 仅 14%;带工具时入门关卡轻松通过、单次思考多在 5 分钟内,无工具时平均每次规划 9 分钟、峰值超 20 分钟,世界模型以约一半成本换 60% 提升。
所属事件:MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理(6 条相关)→
「模型」频道最新
- Agent Arena 榜单:DeepSeek V4.1 Flash 以 $0.06/任务挤进 Pareto 前沿 — arena · 2026-09-15
- 23 天没开 Claude Code:博主称 Codex 配开源模型更顺手 — Yuchenj_UW · 2026-09-15
- 深度估计模型 Marigold-V2 冲上 Hugging Face 热榜 — toshas · 2026-09-15
- 曝 OpenAI 雇数百合同工人工审读 ChatGPT 对话 — The Decoder · 2026-09-15
- Hugging Face 团队梳理:哪些开源 LLM 最适合端侧推理 — NielsRogge · 2026-09-15
- 用户实测指认:推理商 nahcrof 疑用 tokenizer 不符的模型冒充 Kimi K3 — xeophon · 2026-09-15