前沿推理模型解迷宫失败率超九成,研究揭示短板

thebigbigbuddha · reddit · 2026-09-02

MultiNet 2.0 研究通过简单的 2D 迷宫测试前沿模型的长程交互任务能力。这些迷宫对人类来说极其简单,但要求模型持续感知、推理、行动并追踪进度。在 150 次评估运行中,前沿模型仅解决了 6 个。该研究旨在分析模型在长期任务中的失败模式,并将于 9 月 11 日进行详细直播讲解。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →