新基准测试:用 200+ 推箱子房间挖掘 Agent 规划能力

generativist · x · 2026-07-31

一个全新的 AI Agent 评估基准引起了关注。该测试要求智能体在 200 多个房间中,通过完成类似「推箱子」的谜题来寻找 100 颗隐藏的宝石。

虽然游戏规则十分简单,但难度会急剧上升。据悉,所有谜题均由人工设计,并在内部由人类完成了解答验证。这种基于经典逻辑解谜的测试,为衡量大模型和智能体的长程规划与空间推理能力提供了新的硬核视角。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →