MazeBench 把迷宫评测做成带摄像头控制的持续学习基准
xeophon · x · 2026-07-28
MazeBench 不只是普通迷宫:有些关卡还需要 控制摄像头,让纯 brute-force 更难奏效。
作者还指出,基准中存在会反复出现的技巧,模型需要跨关卡学习,因此他们把它定义成一个 持续学习型 benchmark,而不是一次性的谜题集合。
所属事件:MazeBench:引入新颖度评分的持续学习3D迷宫基准(2 条相关)→
「编程与Agent」频道最新
- AI工具Robin将暗网调研缩短至30分钟 — tom_doerr · 2026-07-28
- Excel+LLM 系统的瓶颈是业务知识无损传递 — Tired40s · 2026-07-28
- 四个模型同题做游戏,Opus 5 像完整成品 — victor_explore · 2026-07-28
- 生产级 agent 需要结构化评测流水线 — blaizedsouza · 2026-07-28
- 重试 agent 步骤,不等于安全恢复 14 步工作流 — msignificantdigit · 2026-07-28
- 长跑 Agent 的上下文管理只有三种解法 — blaizedsouza · 2026-07-28