微软论文:给 Agent 记忆管理器加只读校验工具,Copilot 通过率 39%→73%
dair_ai · x · 2026-09-11
微软研究者针对生产级 Agent 持久记忆的痛点发布新论文:传统 memory curator 只读最终轨迹,容易保存错误、从片面证据过度泛化、保留过时事实。
方法:给 curator 提供几个只读工具,在每条候选记忆写入前先对照实时环境校验。任务 agent、检索器和记忆格式全部不动,无需重训练。
结果:
- GitHub Copilot 测试环境(CLDBench)上,通过率从 39% 升至 73%
- 每问题查询数从 8.8 降至 4.7,任务 agent 成本从 $3.38 降至 $1.68
- 跨 6 个环境的 90 个咨询任务上,所有记忆配置均优于基线,工具调用减少 16%75%
对运行生产级持久记忆 Agent 的团队尤具参考价值。
「编程与Agent」频道最新
- Agora 开源会议 Copilot:GPT-Live-1 可边听边说、自动建任务 — testingcatalog · 2026-09-12
- GPT-Live-1 加入视频会议当参会者,实时转录答疑还能建任务 — testingcatalog · 2026-09-12
- 前工程管理者:我现在像带团队一样管理一群 Claude 和 Codex agent — letandrewcook · 2026-09-12
- 实测发现:astra 极度吃上下文,极简 prompt 反而大幅拉低表现 — brandon_galang · 2026-09-12
- DeepSeek 无官方编码 harness,社区版 Deep Code CLI 星标破 2.2k — PawelHuryn · 2026-09-11
- EvoHarnessBench:给 Agent 不断加工具,反而可能让它变差 — mohitban47 · 2026-09-11