网页 Agent 环境经验记忆拉到 1.15 亿 token,编码 Agent 平均 72.5%

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

cs.CL

2026-05-13

UCLA 发布网页 Agent 长期记忆基准 LME-V2:451 道人工题,历史最长约 500 条轨迹、1.15 亿 token。带脚手架的编码 Agent 平均准确率 72.5%,高于最强 RAG 的 48.5% 和裸 Codex 的 69.3%。

这篇在解决什么

现有 Agent 记忆评测大多在测两件事:用户聊过什么,或者下游任务成没成功。聊天记录相对干净;任务成功率又把记忆质量和规划、工具调用搅在一起。真正缺的是:一个 Agent 在定制网站上干过几百次之后,有没有把界面长什么样、状态怎么变、流程怎么走、坑在哪,内化成老同事那种环境经验。

LongMemEval-V2(LME-V2)把这个问题单独拎出来。UCLA 团队从 WebArena 和 WorkArena 的 Magento 购物站、购物后台、Postmill 论坛、ServiceNow 上收集轨迹,人工写了 451 道题,覆盖五种能力:静态状态回忆、动态状态追踪、工作流知识、环境坑(gotchas)、前提觉察(premise awareness)。历史最长约 498 条轨迹、1.148 亿 token。不给轨迹时,扫过的前沿模型最好也只有 14.1%(Kimi-K2.5),这些题靠公开站点的参数知识答不了。

方法

评测做成 context gathering:记忆系统提供 Insert 和 Query 两个接口。轨迹一条条灌进去,Query 返回一段压缩证据,截断到 20 万 token,再交给固定的 Qwen3.5-9B reader 答题。测的是记忆模块本身,不是端到端任务成功率。

基线合称 AgentRunbook,两套设计。

轨迹来自 AgentLab,用 GPT-5.2 和 GPT-5-mini 做拒绝采样,最终 599 条 WebArena、941 条 WorkArena,成功率 52.0%,平均 28.1 个状态。题目全部人工写,并用 Gemini-3-Pro、GPT-5.2、Grok-4.1、Claude-Opus-4.6 过滤,至少两家答错才留下。平均每题只需 1.4 条含答案轨迹(最少 1、最多 5),干草堆里针很稀。LME-V2-Small 是 100 条共享轨迹、2560 万 token;Medium 约 498 条、1.148 亿 token。成功和失败轨迹都放进去,不少题只能从失败轨迹里找答案。题目格式里选择题占 50.1%,短答 34.6%,自由回答 15.3%;约 102 道是带着错误前提的拒答题。

结果

无检索几乎为零(1.3%)。简单「问题→状态切片」RAG 在 Small / Medium 上分别 42.8% 和 38.1%。加上笔记变成 51.0% 和 45.9%。AgentRunbook-R 提到 58.6% 和 57.0%,延迟约 26 秒。去掉原始切片池之后,静态题从 66.1% 掉到 28.6%,细粒度 UI 证据是这一类的命门。

编码 Agent 家族高一截。裸 Codex(GPT-5.4-mini,xhigh 推理)69.9% / 68.7%,查询要 177–186 秒。AgentRunbook-C 最好:74.9% / 70.1%,两档平均 72.5%,延迟 108.3 / 139.9 秒,比裸 Codex 快约 32%。消融显示工作流指令对准确率最稳;manifest 主要省时间;helper 在 Small 上有用,Medium 上并不总涨分。

方法SmallMedium延迟(Small)
无检索1.3%1.3%0s
RAG 切片+笔记51.0%45.9%0.2s
AgentRunbook-R58.6%57.0%26.9s
裸 Codex69.9%68.7%177s
AgentRunbook-C74.9%70.1%108s

Gotchas 是硬骨头。AgentRunbook-C 在这一类上弱于裸 Codex(Small:48.3% 对 58.6%;Medium:44.9% 对 51.7%)。脚手架把 Agent 往「按清单取证」推,带截图的坑题可能被少看。Oracle 上限也不高:把含答案的轨迹文件直接交给 Codex,总体 89.7%,gotchas 只有 51.7%。证据就在眼前,环境坑也难读完。

无上下文时 Kimi-K2.5 最好 14.1%,Grok-4.20 只有 2.4%。给 GPT-5.4-mini oracle 切片加笔记,能到 86.3%。缺口在记忆系统,题本身大部分有解。

Medium 档上,Codex 平均每题做 21.8 次原始轨迹探索;AgentRunbook-C 把这类操作压到 1.2 次,换成 18.0 次清单和 helper 调用。脚手架的主要收益是少乱逛、查询更快,准确率只多了几个点。

为什么重要

Agent 记忆评测从「记住用户说过什么」挪到「记住这个环境怎么运转」。对做网页 Agent、企业工作流 Agent 的人,这意味着 Mem0、A-MEM 这类偏对话事实的方案,直接搬到嘈杂轨迹上会不够用。低层 UI 观察和高层流程笔记都得留。

更直接的工程信号:编码 Agent 可以当记忆控制器,但必须加工作流、清单和检查脚本,否则又慢又乱逛。延迟预算只有几十秒时,AgentRunbook-R 大约 58% 是目前能拿到的效率点。72.5% 相对 48.5% 的 RAG 是一截,相对老同事还差得远。这是一张更难的考卷加上渐进方法,不是新架构。

局限与存疑

作者写明了范围:只覆盖定制浏览器环境,没有编码 Agent、电脑使用 Agent、真实企业系统;评测用预收集轨迹,不是在线边干边学;测的是给固定 reader 交证据,不是端到端任务成功率。方法侧没有新模型、没有训练,AgentRunbook-C 也没有从零做定制 harness。

还有几处读下来站不太稳。主表没单独报 premise / abstention 准确率,附录只说 AgentRunbook-C 在这一类上有改进,因为指令要求它显式指出错误前提。451 题里约 102 道是 abstention,这一类怎么计入 Overall,正文没讲清。Gotchas 用 LLM judge(GPT-5.2),自由回答也用 judge,和结构化匹配混在同一张表里。Medium 档 helper 消融准确率 71.8%,高于完整系统的 70.1%,全套脚手架并不单调更好。历史 1.15 亿 token,Query 输出截到 20 万,测的是压缩取证,不是超长上下文阅读。

术语

原文与代码

社区讨论

相关论文

全部论文解读