GPT-6 Astra 解拓扑难题耗时8小时,MindTopo基准揭示MLLM短板
yining_hong · x · 2026-09-16
- Northwestern、Microsoft Research、Stanford 联合发布拓扑推理基准 MindTopo:基于 5 个皮亚杰式空间原语(连续性、分离、顺序、包围、打结)、13 类任务、11016 个实例,评测 11 个 MLLM。
- 核心结论:前沿模型能在静态场景中识别拓扑关系,却无法在动作序列中维持和操作这些关系——最佳模型仅 54.1%,人类为 97.4%。
- 引用帖演示 GPT-6 Astra 能解复杂空间约束任务(拆解互锁零件、绳穿三环),但第一个任务搜了 1h40m,第二个超 8 小时。
- 作者 Manling Li 认为:推理是核心,值得期待的是模型能否通过搜索抽象出可复用的拓扑结构,并作为可迁移技能简化下一个问题。
「模型」频道最新
- InclusionAI 发布 LLaDA-Image:6B 全扩散架构,90% 训练只用图片 — jiqizhixin · 2026-09-16
- GPT-5.6 Sol 一句 Are you sure 就翻转结论,推理可信度存疑 — Sockand2 · 2026-09-16
- 学生实测:Opus 与 ChatGPT 先狠批幻灯片,见原始材料即改口 — Kazoru4 · 2026-09-16
- 奥特曼称内部超 Astra 模型能解世界顶尖数学家解不开的问题 — rohanpaul_ai · 2026-09-16
- agent 编辑无关文档时突然冒出用户没说过的内容 — Kyrannio · 2026-09-16
- OpenAI 反向操作:chat 模式设上限,work 模式反而不限 — koltregaskes · 2026-09-16