Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets
Dat Tran, Douwe Kiela
cs.CL, cs.MA
2026-04-03
斯坦福把思考token预算钉死后,Qwen3、DeepSeek-R1与Gemini 2.5上单智能体匹配或超过五种多智能体架构。多智能体要到单智能体上下文被严重污染时才翻盘。
多智能体论文常报更高分,同时默默花掉更多测试时计算:更长思维链、更多轮对话、更多角色。预算一对齐,很多花活打不过强单智能体。缺的是两块:为什么在信息论上单智能体不该更差,以及多智能体到底在哪种失效里才该上场。
斯坦福的 Dat Tran 与 Douwe Kiela 把「思考 token」定义为中间推理用掉的 token,不含提示和最终答案,专门拿多跳问答来拆这个账。
理论侧很短。正确答案 Y、单智能体看到的完整上下文 C、多智能体之间传递的消息 M=g(C)。Y ↔ C ↔ M 是马尔可夫链,数据处理不等式给出 I(Y; C) ≥ I(Y; M),于是理想情况下单智能体的最小错误率不会更差。单智能体若用不好 C,有效上下文变成降质后的 C̃α,不等式就不再保证它压过一个结构化的 M。预测随之而来:上下文干净时 SAS 该赢;上下文被删、被掩、被替换、塞进不相干句子时,MAS 才有机会。
实验侧在 FRAMES 和 MuSiQue 的 4-hop 子集上,对齐全局思考预算 B ∈ {100, 500, 1k, 2k, 5k, 10k}。模型是 Qwen3-30B-A3B、DeepSeek-R1-Distill-Llama-70B、Gemini-2.5-Flash 与 Pro。SAS 一次吃完整预算。SAS-L 仍是单次调用,只在用户消息里加一段「先列歧义再作答」的支架,用来逼 Gemini 把思维通道写满。MAS 包括 Sequential(主对照:规划器拆步、工人串行、聚合器汇总)、子任务并行、角色并行、辩论、集成。规划器和聚合器尽量预算中性。对错由另一模型按固定量规做语义等价判断。
除了 100 token 这种几乎写不出推理的档,SAS 在各模型、两套数据上是最优或与最优置信区间重叠。2000 token 档的全表平均:SAS 0.421,SAS-L 0.420,Sequential 0.389,Debate 0.403,Ensemble 0.372。10000 token 档:SAS 0.426,Sequential 0.387,Debate 0.420。预算从 1k/2k 再到 5k/10k,平均分变平,继续加思考长度会出现空转。Debate 是最稳的 MAS,Parallel-roles 其次;Ensemble 在低中预算偏弱,只在 Gemini-2.5-Pro 的 FRAMES 高预算上翻到最前。SAS-L 基本是 Gemini 现象:Flash 的 MuSiQue 上它常超过普通 SAS,开源模型上中高预算反而经常更差。
Gemini 的 API 记账会把对比拧歪。Flash 上请求 10k 思考预算时,SAS 的 API 回报平均 1,687 thinking tokens,可见思维文本大约 251 词、折合 359 token,虚高约 4.7 倍。可见思维还封顶:Flash 的 SAS 在 1k 和 10k 请求下分别大约 354 与 359 token。Sequential 因为多次调用,1k 预算的 Pro 上可见思维大约 693 vs SAS 的 390。表面「MAS 更会想」,有一块是会计口径。
上下文降质实验(Qwen3、MuSiQue、1000 token)把理论预测落到数字上。掩码和替换在轻度 α=0.3 时 SAS 领先,中度接近,重度 α=0.7 时 Sequential 反超。随机删除趋势更弱;加入不相干句子时两边都掉,SAS 仍领先、只是优势变薄。MAS 有用的时刻,是单条思路分不清相关信息和误导信息,不是上下文单纯变长。
改写实验还提示:浅改写掉分、深改写反升,原题可能有记忆痕迹。标准基准会把「会背」计进架构胜利。
如果业务是多跳事实问答、检索后推理,默认应先把思考预算给一个单智能体,而不是先上辩论团。论文没有说 MAS 永远更差:上下文被噪声污染、单次注意力用不好长输入时,结构化拆步可以当滤波器。它说的是,很多已发表的 MAS 优势,用没入账的计算和更长的可见思维就能解释。
和 Nature 那篇「能力过阈值就别加智能体」互补。那篇有工具和环境,结论挂在任务能不能并行;这篇把环境拿掉,只留多跳推理和思考 token,结论更硬。写代码、修仓库不要直接套用这里的数字。
任务只有两个多跳问答集,没有工具、没有仓库、没有网页。评判器是 LLM-as-judge,量规固定,仍可能偏某类表述。Gemini 的 thinkingBudget 官方就写成指导值而非硬顶,Flash/Pro 的可见思维封顶让「对齐预算」在闭源 API 上只是近似。SAS-L 说明提示词能改变思维长度,那 MAS 的提示工程同样可能被低估或高估。α=0.7 的掩码/替换已经很不自然,更像压力测试,不像产品里的长文档。数据处理不等式假设 M 是 C 的函数;若工人能调工具拿到 C 里没有的新证据,这条上界要重写,本文没做。