MazeBench 横评:GPT-6 Astra 裸跑已胜过 GPT-5.6 Sol 带工具
patience_cave · x · 2026-09-14
patiencecave 发布 MazeBench 3D 空间推理基准的模型横评:GPT-6「Astra」带代码执行的分数比 GPT-5.6「Sol」带代码执行近乎翻倍;更大的意外是,Astra 不用代码执行的裸跑成绩也超过了带工具的 GPT-5.6 Sol。
作者认为这显示 Astra 是一个很强的智能体,同时此前测试表明长隧道等场景下 3D 空间推理仍有明显短板。
「模型」频道最新
- 开源 Swift-Qwen3.8-27B:思考 token 减 58%,速度翻倍精度几乎不掉 — Secure_Recording_472 · 2026-09-14
- 网友实测:Astra 长对话幻觉明显比上一代更严重 — FigInternational4873 · 2026-09-14
- 蚂蚁 Ling-3.0-flash-Fin 推出 FP8/FP4/INT4 三种量化版本 — Med1_Ai · 2026-09-14
- François Fleuret 实测:按官方文档写 prompt,16GB 4060Ti 本地跑 MiniMax 表现出色 — francoisfleuret · 2026-09-14
- 攻击者披露当天即利用 87% 漏洞,GPT-6 Astra 在 ExploitBench 满分 — PeterDiamandis · 2026-09-14
- GPT-6 Astra 花 2 小时插好网线,作者指机器人速度仍是瓶颈 — ZeeshanZiaML · 2026-09-14