MazeBench 用 novelty score 防止智能体长跑打转
xeophon · x · 2026-07-28
MazeBench 作者补充了他们的评测控制方式:智能体可以运行大约 O(M) tokens,但一旦 novelty score 判断它在原地绕圈,就会被终止,以免浪费算力。
配图展示了在长任务中 novelty 随 moves 逐步下降的过程,也说明为什么这种“防打转”机制对长视野迷宫任务很重要。
所属事件:MazeBench:引入新颖度评分的持续学习3D迷宫基准(2 条相关)→
「编程与Agent」频道最新
- AI工具Robin将暗网调研缩短至30分钟 — tom_doerr · 2026-07-28
- Excel+LLM 系统的瓶颈是业务知识无损传递 — Tired40s · 2026-07-28
- 四个模型同题做游戏,Opus 5 像完整成品 — victor_explore · 2026-07-28
- 生产级 agent 需要结构化评测流水线 — blaizedsouza · 2026-07-28
- 重试 agent 步骤,不等于安全恢复 14 步工作流 — msignificantdigit · 2026-07-28
- 长跑 Agent 的上下文管理只有三种解法 — blaizedsouza · 2026-07-28