多智能体有效通信图大约六种,VQ码本2.4毫秒选出并少花两到三成token

Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems

Jinxi Yu, Yubei Li, Eric Hanchen Jiang, Zhi Zhang, Dong Liu, Wenxiao Zhao, Levina Li, Kai-Wei Chang, Ying Nian Wu

cs.AI, cs.LG, cs.MA

2026-09-02

UCLA用16槽VQ码本把多智能体通信图压成约六种有效拓扑,平均准确率84.6,比最强生成式设计器高1.6点,出图2.4毫秒、token少22%–33%。

这篇在解决什么

给一队 LLM agent 出题,谁跟谁说话、消息按什么顺序传,直接决定答对没有、花多少 token。固定拓扑省事,但没有一张图适合所有题:数学可能吃全连接,代码可能吃星型。近年的做法是按每道查询生成一张通信图。变分、自回归或扩散解码器在 N×N 邻接空间里搜,图网络再按正确率和边数给候选打分。

UCLA 这篇把三件测量摆出来,说明这套配方对不上问题。过了奖励过滤的拓扑,码本容量从 8 扩到 64,实际用上的还是大约六种图;最好的固定拓扑离所有生成拓扑不超过 1.4 个准确率点。边数和实测 token 的 Pearson 相关约 -0.4:图越稀,补全越长,账单越高。公开基准里 agent 画像几乎同质,消息传递打分对邻接矩阵不变,所有候选拿到同一分数。

方法

Codebook Agent 把设计摊成三段前馈,测试时不再搜图。

线下在每个基准的 50 道训练题上跑 6 种固定拓扑(全连接、链、星、三种 Erdős–Rényi),留下 300 条记录:邻接矩阵、查询嵌入、对错、token 数。复合奖励是正确率减去 λ=0.1 的任务内归一化 token,难度被同题均值除掉。

测试时取预测器 top-5 码,去重后一次 batch 过代理,选 û−λĉ 最大的那张图去执行。拓扑生成路径上没有 LLM 调用。

结果

gpt-4o-mini、六项基准,Codebook Agent 平均 84.62,六列全第一。Vanilla 是 77.63,最强先验设计器 GTD 是 83.02。分项:GSM8K 94.8、MATH 56.5、MultiArith 99.4、SVAMP 95.4、MBPP 83.5、HumanEval 78.1。相对 GTD 的增益摊开:GSM8K +1.3,MATH +1.0,MBPP +3.1,HumanEval +0.6。

方法平均准确率出图延迟
Vanilla77.63无设计器
DyLAN80.18无设计器
GTD83.02301–396 ms
Codebook Agent84.622.4 ms

token 相对「迭代解码器 + 边数 GNN」流水线少 21.9%–33.2%:GSM8K 1239→927,MATH 2304→1611,HumanEval 同质队 699→546、异质队 624→417。MATH 端到端墙钟从 43.7 分钟降到 27.4。换 Qwen-3-8B,平均 74.0,仍高于 GTD 的 72.7。

消融把机制拆开。K≥8 时编码器最多用六个码,再加大码本几乎不涨点。同质团队上,同一批候选用 GNN 重排,GSM8K 要 1711 token,随机只要 1249,MLP 只要 927;准确率差不超过 1.5 点,排名买的是成本。最好的固定拓扑已经很接近生成结果。

为什么重要

多智能体拓扑被写成条件图生成,这篇说有效图就那么几张,该做的是索引,再按实测 token 挑。2.4 毫秒相对端到端可以忽略,真正省的是调用次数。还在用稀疏化省钱的人要注意:边数当成本代理会把系统推向更贵的图。

准确率只比 GTD 高约 1.6 点,这是渐进改进。卖点是问题诊断和摊销,不是又一个更强的生成器。新场景仍要付一次 300 条真实执行的收集成本。

局限与存疑

最好固定拓扑已经贴着生成结果,设计器很大一块工作是在短名单里选。每配置只跑一次评估,没有方差。异质 HumanEval 上 incumbent GNN 准确率 78.8,略高于这边的 78.1。倒挂相关来自他们自己的执行记录,换任务未必成立。码本训练后与查询无关,团队规模一变要重训。论文没验证码本换到全新角色集合时还能不能用。

术语

原文与代码

社区讨论

相关论文

全部论文解读