牛津清华等联合发起 Agent 记忆挑战赛
JundeMorsenWu · x · 2026-08-02
由牛津大学、清华大学等 20 余所高校联合组织的 Agent Memory Challenge 正式开放提交,旨在统一、公平地评测不同智能体记忆系统的长期记忆能力。
赛事核心设计:
- 统一接口与评测:参赛系统只需实现 add(写入)和 search(检索)两个接口,回答生成与评分均由平台统一执行,以消除不同 Answer 模型和评分模型带来的差异。
- 数据规模:包含文本与代码两大评测榜单。文本榜涵盖 1,559 段对话(约 1.5 亿字符)和约 5,000 个多维问题;代码榜基于 12 个真实 GitHub 仓库的 344 个软件工程任务。
- 能力维度:考察显式事实召回、多跳关系组合、记忆治理(更新与遗忘)、个性化以及隐私安全等能力。
首期提交截止日期为 8 月 7 日,分为学术方法榜与商业产品榜。
「编程与Agent」频道最新
- 实测:AI Agent全权接管Facebook广告,月花1500刀效果超人工 — PrajwalTomar_ · 2026-08-02
- Agensis发布:人机混编的AI Agent协作桌面端 — jasonkneen · 2026-08-02
- 将AI Agent融入CI/CD:软件工厂的自动化实践 — TejasKumar_ · 2026-08-02
- ChatGPT macOS桌面端新玩法:一键截图喂给AI写代码 — jxnlco · 2026-08-02
- MCPRadar:开源 MCP 服务器安全扫描与排行榜 — tatar-sh · 2026-08-02
- 买 5000 美元 Mac Studio 本想跑本地模型,结果全用来开多智能体 — EverydayAI_ · 2026-08-02