Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents
Dongming Jiang, Yi Li, Bingzhe Li
cs.AI, cs.LG
2026-09-21
Jev-Mem 用非自回归的 System-One 控制器接管记忆写入、路由与停搜,把 LLM 留给最终答题。LoCoMo 上 Judge 分 0.777,相对最强基线 MAGMA 高 11%,建库 158 秒、查询 0.93 秒。
长程 agent 要把用户偏好、任务历史和环境知识留在上下文窗外,记忆系统就从「存一段对话」变成了持续做决定:这条要不要建边、这个问题该走哪张图、证据够不够可以停。现有做法两端都别扭。启发式便宜但死板;把每次判断丢给自回归 LLM,生成就坐在记忆的关键路径上,建库动辄三千秒。
UT Dallas 的 Jiang、Li、Li 把这个问题写成 System-One / System-Two 的分工。记忆控制是高频、输出空间很小的结构化判断,适合轻量的 System-One;答题和深推理才交给 System-Two 的 LLM。控制器的具体实现是 TypeSafe AI 的 Jev:直接吐类型化概率,不走逐 token 生成。
Jev-Mem 三层。共享数据面把每条观察收成规范节点,上面叠四张关系图:语义、时间、因果、实体,外加向量索引和词法索引。System-One 控制面管写入和读取。System-Two 只在最后合成答案,必要时才升级一次合并或摘要。
写入不做「存或丢」的不可逆决定,先把观察留下,免得当时看着不重要、以后问到却没了。控制器给节点打四个可重叠的类型分:情景、语义、程序性、偏好。对着整库比关系会随库膨胀,所以先用向量、词法、共享实体和时间邻近抽出至多 Kw 个候选,再只对候选对做关系判断。时间戳能直接定序就不定序,实体 ID 对得上就直接连。推断边要过阈值 θrel 才写入。
读取不是一次 top-k。控制器先预测每张图对当前问题的用处、要不要多跳、新近程度重不重,再按概率把扩展预算 B 分给激活的图。锚点用向量和关键词的倒数排名融合(κ=60)。每一轮评估四件事:证据够不够、再搜还有没有用、缺的是不是关键证据、有没有没解开的矛盾。够了就停,继续也没好处也停。还要扩的话,新节点按问题相关性、关系用处、新颖度、对当前证据的支持,再加上嵌入相似度和边权打分,取 beam 继续。控制开销有硬顶:写入一次分类型、一次关系;查询一次路由,每轮最多一次证据评估加一次候选打分。
评测在 LoCoMo 超长多轮对话上,答题骨干统一 gpt-4o-mini,指标是 LLM-as-a-Judge。基线含直接塞全文、A-MEM、MemoryOS、Nemori、以及同一组作者更早的多关系图 MAGMA。
| 方法 | 多跳 | 时间 | 开放域 | 单跳 | 对抗 | 总体 |
| Full Context | 0.468 | 0.562 | 0.486 | 0.630 | 0.205 | 0.481 |
| MAGMA | 0.528 | 0.650 | 0.517 | 0.776 | 0.742 | 0.700 |
| Jev-Mem | 0.623 | 0.637 | 0.618 | 0.802 | 0.962 | 0.777 |
总体 0.777,相对最强基线 MAGMA 的 0.700 高 11.0%。六类里五类最高;时间项 0.637,略低于 MAGMA 的 0.650。拉开最大的是对抗题 0.962 对 0.742,以及开放域 0.618 对 0.517。
| 方法 | 建库 (s) | 查询 (s) |
| A-MEM | 3636 | 2.26 |
| MemoryOS | 3276 | 32.68 |
| Nemori | 1044 | 2.59 |
| MAGMA | 1404 | 1.47 |
| Jev-Mem | 158 | 0.93 |
建库 158 秒,相对最快的记忆系统 Nemori(1044 秒)是 6.6 倍。查询 0.93 秒,相对 MAGMA 的 1.47 秒低 36.7%,也低于直接塞全文的 1.74 秒。MemoryOS 单次查询要 32.68 秒。
引言写「两个常用基准」,正文只报了 LoCoMo。
agent 记忆这条线最近一年图越来越密,控制成本跟着涨。Jev-Mem 把「记忆该怎么管」从生成循环里抠出来,写成可批处理的概率决策。有人在做级联和投机解码,把整次请求分给大小模型;这里把粒度切到记忆生命周期里的每一次打标、路由和停搜。
能用的前提很具体。你已经在用多关系图记忆,并且接受一个非自回归的类型化控制器。LoCoMo 上质量和时延一起动,说明这条路至少在对话记忆上不是空话。它是架构改进,不是新的记忆表示。MAGMA 已经把四张图摆好了,这篇换的是谁来做决定。
论文没有 Limitations 节。最直接的缺口是评测面:口上两个基准,表上只有 LoCoMo;没有把 System-One 换成启发式或换成 LLM-as-controller 的消融,所以 11% 和 6.6 倍里有多少来自控制器、有多少来自检索循环,分不开。MAGMA 是同一组作者的前作,也是最强基线,时间项还略高,对照并不中立。
Jev 是 TypeSafe AI 的外部组件,文中几乎不谈它的模型大小、训练数据和失败模式。答题和打分都走 gpt-4o-mini 的 LLM-as-a-Judge,没有人类核对。正文叙述和表格在多跳、开放域、单跳上差了几个百分点,应以表格为准。
没有工具使用、代码仓库或网页浏览的长程任务。自适应停搜在 LoCoMo 上有效,换到动作会留下副作用的环境,还没有证据。