多智能体用隐状态读心协作,Qwen-1.7B 数学准确率到 93%

Thought Communication in Multiagent Collaboration

Yujia Zheng, Zhuokai Zhao, Zijian Li, Yaqi Xie, Mingze Gao, Lizhu Zhang, Kun Zhang

NeurIPS 2025 Spotlight

cs.LG, cs.AI, cs.MA

2025-10-24

CMU 与 Meta 提出 ThoughtComm,从隐状态拆出共享与私有想法再注入前缀。三智能体两轮辩论下,Qwen-3-1.7B 的 MATH 准确率从单模型 43.6% 升到 93%。

这篇在解决什么

多 LLM 智能体现在还是在互发自然语言。语言有损、含糊、间接。Cemri 等人把大量协作失败归到消息写不清楚、彼此对不齐,根子都在这条通道。机器没有声带,理论上可以走更直接的路。

现有 MAS 已经试过改拓扑、改 workflow、改到 token 级协作,甚至交换 embedding。媒介仍是语言。这篇要问:能不能把「想法」本身抽出来传。

方法

通信前各智能体的模型状态(最后生成 token 的隐层表示)被看成由一组潜变量「想法」经未知可逆函数生成。Jacobian 的非零模式决定哪个想法影响哪个智能体。在无辅助信息的非参数设定下,对生成函数的 Jacobian 做稀疏正则,任意一对智能体的共享想法、私有想法都能被解开,全局的想法–智能体归属结构也能恢复,只差一个置换。

工程实现叫 ThoughtComm。稀疏自编码器从拼接的隐状态里抽出估计的想法,再用 Jacobian 掩码把相关维度路由给每个智能体,按「有多少智能体共享这个维度」分组加权。加权结果经 adapter 变成 prefix,接到下一轮生成的 token embedding 前面。自编码器只重建隐状态,adapter 只保证注入后语言还通顺,两块都相对任务无关,可以预训练一次复用。

实验用三智能体、两轮辩论,500 题微调通信模块、500 题评测。对照是单模型,以及要把整个 LLM 都微调的 Multiagent Finetuning。

结果

MATH 上数字最硬:

基座单模型Multiagent FTThoughtComm
Qwen-3-0.6B45.8071.2085.00
Qwen-3-1.7B43.6075.8093.00
Phi-4-mini 3.84B63.8060.2074.60
Llama-3-8B36.2039.6845.60
DeepSeek-R1-Distill-Llama-8B42.6072.4082.80

Qwen-3-1.7B 相对单模型涨 49.4 个点,相对 Multiagent FT 涨 17.2 个点。作者汇总成相对单模型 +67.23%、相对当时 SOTA +19.06%。GSM8K 上多数设置仍领先,但 Llama-3-8B 是 68.40,略低于 FT 的 69.20。Phi-4-mini 上全量微调反而从单模型 63.80 掉到 60.20,ThoughtComm 拉回到 74.60,说明多一轮语言辩论并不自动等于更好。

合成数据里,带稀疏正则的自编码器能把共享区和两个私有区对上,无稀疏的基线解不开。8 组设定、维度 124 到 1024,MCC 过了可识别常用阈值。辩论轮数从 2 加到 6,FT 准确率掉、共识还在涨,属于空共识;ThoughtComm 两边一起涨。prefix 长度从 1 拉到 16,波动不到五个点。

为什么重要

这是把因果表示学习的可识别性接到 MAS 通信上。训练开销只跟 embedding 维有关:Llama-3-70B 和 405B 都是 16384 维,额外训练不随参数量膨胀。闭源模型拿不到隐状态,作者自己也写了。

局限与存疑

实验依赖开源模型的隐状态。闭源 API 只能改走观测数据的 embedding,这篇没做。评测只有数学推理、最大 8B、固定三智能体两轮,和真实 MAS 差一截。Llama-3-8B 在 GSM8K 上没赢 FT,「读心」不是免费午餐。可识别性保证的是统计意义上的解开,并不等于抽出来的维度对应人类能叫出名字的概念。

术语

原文与代码

社区讨论

相关论文

全部论文解读