UCLA 提 LongMemEval-V2:Agent 需像老同事一样熟记环境
dair_ai · x · 2026-08-27
现有 Agent 记忆基准多测试用户历史回忆,但生产环境更需要 Agent 内部化环境特征(如界面怪癖、状态动态)。UCLA 新论文推出 LongMemEval-V2 基准,包含 451 个手动策划的问题,覆盖五种网络 Agent 记忆能力:静态状态回忆、动态状态跟踪、工作流知识、环境陷阱识别、前提感知。历史轨迹可扩展至每个问题 500 条轨迹和 1.15 亿 Token。
提出的 AgentRunbook-C 方法将轨迹存为文件,让编码 Agent 在沙盒中收集证据。该方法平均准确率达 72.5%,显著强于最强 RAG 基线(48.5%)和现成编码 Agent(69.3%)。
「编程与Agent」频道最新
- WebMCP 与常规 MCP 区别解析 — VeryWellVersed · 2026-08-27
- 纽约布朗克斯高中生举办 AI 开发大赛,支持社区商业 — ziv_ravid · 2026-08-27
- 用 Claude + Codex 自动化处理印度次大陆语言书籍,收到解析成功的邮件 — aryaman2020 · 2026-08-27
- 网友称给 Grok 75 美元本金,两天滚成 6140 美元 — RachelVT42 · 2026-08-27
- 编码工作流中哪些任务值得调用最强模型? — whereismy1 · 2026-08-27
- WebMCP 被曝能让网站无缝接入 Agent,仅需嵌入 JS — HankYeomans · 2026-08-27