GPT-6 Astra 跑 MazeBench:4 亿 token 24 小时推理仅得 23%
patience_cave · x · 2026-09-14
博主 patiencecave 用自建的 3D 迷宫基准 MazeBench 测试 GPT-6「Astra」+Python 代码执行:消耗 4 亿 token、推理 24 小时后最终得分仅 23%;不用 Python 时得分降到 14%。
作者观察:Astra 能理解从拱门下走过等空间概念,但隧道变长后就「不敢盲飞」,3D 空间推理仍有很大提升空间。
所属事件:MazeBench 实测 GPT-6 Astra:4 亿 token 24 小时仅得 23%(4 条相关)→
「模型」频道最新
- 开源 Swift-Qwen3.8-27B:思考 token 减 58%,速度翻倍精度几乎不掉 — Secure_Recording_472 · 2026-09-14
- 网友实测:Astra 长对话幻觉明显比上一代更严重 — FigInternational4873 · 2026-09-14
- 蚂蚁 Ling-3.0-flash-Fin 推出 FP8/FP4/INT4 三种量化版本 — Med1_Ai · 2026-09-14
- François Fleuret 实测:按官方文档写 prompt,16GB 4060Ti 本地跑 MiniMax 表现出色 — francoisfleuret · 2026-09-14
- 攻击者披露当天即利用 87% 漏洞,GPT-6 Astra 在 ExploitBench 满分 — PeterDiamandis · 2026-09-14
- GPT-6 Astra 花 2 小时插好网线,作者指机器人速度仍是瓶颈 — ZeeshanZiaML · 2026-09-14