Σ-Mem:多智能体存张可信度记忆表,弱模型选 peer 从 46% 拉到 71%

$Σ$-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

Peilin Feng, Suorong Yang, Soujanya Poria

cs.MA, cs.AI

2026-07-30

给多智能体加一层可信度记忆:记下每个 peer 在哪类任务靠谱、哪些会一起错,靠正确性反馈在线更新、免重训;读出来即可选 peer 或加权投票,弱中心模型在可靠 peer 切换时从 46% 升到 71%。

这篇在解决什么

多智能体系统里,一个中心模型要协调好几个 peer(agent)。问题在于,中心模型经常没法当场核验 peer 给的答案对不对。一个典型场景是 RAG 任务,支持上下文对中心模型隐藏,几个 peer 同时给出自信又互相一致的回答,中心模型再强也判断不了该信谁。更麻烦的是,peer 之间的一致可能反映的是共同的偏见或相关错误,不是独立佐证。现有 agent 记忆清一色是「内容记忆」,记下说过什么、做过什么,回答不了「这个 peer 在哪类任务上靠得住」「哪几个 peer 会一起翻车」。这篇要补的就是这一层:可信度记忆。

方法

Σ-Mem 存两种证据,都从任务结束后的正确性标签(c 取 +1 或 -1)在线更新:

更新规则是「衰减的旧状态 + 有界的新贡献」,新贡献是秩一的对称矩阵。这里用到 Weyl 不等式:实对称矩阵加一个扰动后,每个特征值的变化不超过扰动的谱范数。意思是任何单次更新都撼动不了记忆的主结构,而长期一致的证据会沿稳定方向累加,噪声被衰减压下去。作者给了定理:随交互轮数 T 增长,信号项饱和、噪声项不增长,信噪比只升不降。这套设计不用重训底座模型,只更新记忆。

记忆写进来后,同一份状态支持三种读法:

结果

在五个 Qwen 中心模型(0.6B 到 9B)上测,peer 池是 Gemma-3-4B-it(数学)、Phi-4-mini(RAG)、Qwen2.5-Coder-7B(代码),用 2963 条事件训练。最能说明问题的是反事实攻击实验(故意让原来靠谱的 peer 换人):

设置基线Σ-Mem(含 G)
Qwen3-0.6B @ CF@9046.22%71.10%

CF 等级越高,可靠 peer 切换得越狠。弱模型本来死认 peer 1,Σ-Mem 让它学会跟着切。

泛化上也站得住:训练只见过三个 peer、三个领域(数学 / RAG / 代码),测试时加进没见过的 Llama-3.2-3B、BitCPM-CANN-3B 凑成 4、5 个 peer,以及六个 OOD 基准(PIQA、MMLU、OpenBookQA、SciQ、BBH、SuperGLUE),30 组里 27 组提升。BBH 提升最猛,Qwen3-4B 从 20.38% 到 28.66%,Qwen3-8B 从 19.29% 到 28.17%。

免响应那两档同样能打:M-route 和 M-vote 决策时不调中心模型、不看答案,在整个 OOD 集上仍超过多数投票(59.12%)和最佳固定 peer(57.52%)。说明记忆本身就有用,不依赖中心模型的当场判断。反馈比例消融里,准确率随反馈从 5% 涨到 100% 单调上升,给得越多记忆越准。

为什么重要

第一个贡献是定义了一个新对象:可信度记忆,回答「该信谁、什么时候信」,和内容记忆正交。它的写读接口通用,同一份冻结的记忆能喂给选 peer、路由、投票三种机制,不用为每种单独训练。

第二个贡献是稳定性有数学保证。多智能体场景里反馈天然带噪,朴素累加很容易被一次错误反馈带偏。Weyl 不等式给的界让单次事件翻不了盘,长期一致的可信度才会沉淀下来,这对长程任务很关键。

对从业者:如果在搭多模型编排(peer 池、路由、投票),这套东西给了一个不重训、可在线更新、还能迁移到没见过的 peer 和领域的可信度层。中心模型弱、又没法当场验证答案时收益最大。

局限与存疑

作者很坦诚地点出了边界,而且实验直接演示了它:CF@50 这档(历史证据一半支持原偏好、一半支持切换)Σ-Mem 反而掉点。这不是 bug,是记忆「忠实」的代价,喂进去什么证据就累加什么,模糊的数据流必然产生模糊的记忆。作者把「能自适应平衡历史与当下证据的读法」列为未来工作。

还有几点存疑:

术语

原文与代码

相关论文

全部论文解读