MemGym 为 LLM 智能体做长程记忆评测,覆盖编码和网页任务
dhruv2038 · x · 2026-07-26
MemGym 把 LLM 智能体的“记忆”单独拎出来评测
这项工作认为,现有很多记忆 benchmark 其实只是在测聊天机器人是否记得用户偏好,和真实智能体在长任务中的记忆形成与调用并不相同。为此,作者提出 MemGym,面向深度研究、代码、GUI/电脑使用等更接近真实场景的 agent 记忆评测。
要点包括:
- MemGym 把现有 agent gym 和内部记忆管线统一到一个记忆-推理接口下。
- 覆盖 5 条评测轨道,分成 4 类场景:工具对话、多轮深度研究、编码、电脑使用。
- 提供 memory-isolated score,尽量把记忆能力和推理、检索、工具使用能力解耦,便于比较不同记忆策略。
- 作者还构建了 MemGym-CodeQA 和 MemGym-DR 两条合成管线,支持长度控制并在各阶段做消融验证。
- 为了让代码场景评测更可操作,团队训练了轻量奖励模型 MemRM:基于 Qwen3-1.7B,用 QLoRA 微调,用更快的分数读取来替代完整 Docker rollout。
「编程与Agent」频道最新
- LLM Zoomcamp 演示把 Pydantic AI agent 追踪进 DuckDB 变成 24 张表 — Al_Grigor · 2026-07-26
- CREAO 7 月 30 日办 AI 落地圆桌,聚焦从 demo 到生产 — thetripathi58 · 2026-07-26
- AI Agent 通关《Slay the Spire 2》Ascension 8 并开源轨迹 — bdsqlsz · 2026-07-26
- OpenCode 生态拟收录定时 agent 插件 loop — jkrandom-sudo · 2026-07-26
- 开发者称每月 5 美元可跑出 339.8 小时 agent 算力 — aniketmaurya · 2026-07-26
- 这个循环让模型不断自我质疑直到证明无漏洞 — FinanceYF5 · 2026-07-26