Astra 3D 空间推理实测:用工具规划省一半成本换 60% 提升
patience_cave · x · 2026-09-14
patiencecave 继续发布 GPT-6 Astra 在 3D 环境中的测试细节:带代码执行时,Astra 轻松解出所有入门关卡,单次思考很少超过 5 分钟;无工具时平均每次规划要花 9 分钟,有时超过 20 分钟。
其「世界模型」以约一半的成本换来了约 60% 的性能提升,但长隧道等场景下空间推理仍然吃力。
所属事件:MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理(6 条相关)→
「模型」频道最新
- Sewon Min:自建 agent harness 能大幅降本,现成框架溢价过高 — omarsar0 · 2026-09-15
- Agent Arena 榜单:DeepSeek V4.1 Flash 以 $0.06/任务挤进 Pareto 前沿 — arena · 2026-09-15
- 23 天没开 Claude Code:博主称 Codex 配开源模型更顺手 — Yuchenj_UW · 2026-09-15
- 深度估计模型 Marigold-V2 冲上 Hugging Face 热榜 — toshas · 2026-09-15
- 曝 OpenAI 雇数百合同工人工审读 ChatGPT 对话 — The Decoder · 2026-09-15
- Hugging Face 团队梳理:哪些开源 LLM 最适合端侧推理 — NielsRogge · 2026-09-15