前沿推理模型解迷宫失败率超九成,研究揭示短板
thebigbigbuddha · reddit · 2026-09-02
MultiNet 2.0 研究通过简单的 2D 迷宫测试前沿模型的长程交互任务能力。这些迷宫对人类来说极其简单,但要求模型持续感知、推理、行动并追踪进度。在 150 次评估运行中,前沿模型仅解决了 6 个。该研究旨在分析模型在长期任务中的失败模式,并将于 9 月 11 日进行详细直播讲解。
「漫话AGI」频道最新
- 用户称 LLM 指引能力变差,疑因心智模型同化 — StewartalsopIII · 2026-09-02
- Viskoai 推出 Orbis 1.0:支持实时生成的持久世界 — HeyAmit_ · 2026-09-02
- AI研究新方向:多轮对话优于自动探索 — tokenbender · 2026-09-02
- 奇点可能已在宇宙中多次发生 — jachiam0 · 2026-09-02
- 质疑 AI 对齐观点:为何认为主体越少越安全? — sebkrier · 2026-09-02
- 安全研究者批 AI 安全声明:没人说清验证机制由谁执行 — scifi_tessa · 2026-09-02