UCLA 提 LongMemEval-V2:Agent 需像老同事一样熟记环境

dair_ai · x · 2026-08-27

现有 Agent 记忆基准多测试用户历史回忆,但生产环境更需要 Agent 内部化环境特征(如界面怪癖、状态动态)。UCLA 新论文推出 LongMemEval-V2 基准,包含 451 个手动策划的问题,覆盖五种网络 Agent 记忆能力:静态状态回忆、动态状态跟踪、工作流知识、环境陷阱识别、前提感知。历史轨迹可扩展至每个问题 500 条轨迹和 1.15 亿 Token。

提出的 AgentRunbook-C 方法将轨迹存为文件,让编码 Agent 在沙盒中收集证据。该方法平均准确率达 72.5%,显著强于最强 RAG 基线(48.5%)和现成编码 Agent(69.3%)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →