Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
Andrea Wynn, Harsh Satija, Gillian Hadfield
ICML MAS Workshop 2025
cs.CL, cs.AI, cs.MA
2025-09-05
对照不交换理由的多数票,Du 式辩论在 CSQA 上十组全掉点;弱模型占多数时 MMLU 掉 12 点,正确回答更容易被同伴改错。
Du et al. 2023 那套多智能体辩论已经成了默认招数:几个 LLM 先各自答题,再互相看对方的理由,迭代改答案,最后多数票。先前工作多在同构设置里报涨点,算术、翻译、求真都有正结果。Estornell 和 Liu 甚至给出理论,能力多样应该让辩论更好。
Johns Hopkins 和 Vector Institute 这篇把假设拆开测。他们关心的是异构群体:把 GPT-4o-mini、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.2 按不同配比塞进同一场辩论。对照是同一批 agent 第一轮答案的多数票,即「不交换理由」,不是单模型。问题很具体:交换理由这件事本身,到底在加分还是在帮倒忙。
协议跟 Du et al. 对齐。每题 3 个 agent,T=2 轮辩论。第 0 轮各自独立答;之后每轮把其他 agent 上一轮的回答(超长就再调一次模型做摘要)和自己上一轮的回答拼进 prompt,要求给出更新答案。收尾仍是多数票。每套题抽 100 条,跑 5 个随机种子,温度默认、topp=0.9、最长 2048 tokens。任务是 CommonSenseQA、MMLU、GSM8K。CommonSenseQA 是先前辩论论文没测过的常识选择题,专门用来看这套协议能不能泛化。
辩论 prompt 把同伴输出写成「additional advice」,请模型「给出更新答案」。这个措辞本身就在鼓励改,不在鼓励坚持。
为了拆失败原因,他们又做了三刀。把每轮转移拆成正确→正确、正确→错误、错误→正确、错误→错误。按「有几个同伴同意当前 agent」切片,看孤立的那个会不会更容易改口。仿问卷实验里「答对给钱能压立场偏见」的做法,在 system prompt 里写一个正确性 payoff p=I[X==Y],明确要求最大化收益。
常识问答上,十组配置辩论后全部低于不辩论多数票。这是最硬的一条。
| 配置 | CSQA 前→后 | MMLU 前→后 | GSM8K 前→后 |
| 3× Mistral | 44.4→39.4 ↓5.0 | 33.6→24.4 ↓9.2 | 43.6→46.4 ↑2.8 |
| 3× Llama | 63.0→58.6 ↓4.4 | 61.6→57.8 ↓3.8 | 87.6→84.2 ↓3.4 |
| 3× GPT-4o-mini | 75.6→74.8 ↓0.8 | 81.4→82.2 ↑0.8 | 94.0→94.4 ↑0.4 |
| 1 Llama + 2 Mistral | 53.4→46.8 ↓6.6 | 40.0→28.0 ↓12.0 | 61.0→64.8 ↑3.8 |
| 2 Llama + 1 Mistral | 58.2→50.2 ↓8.0 | 51.8→43.6 ↓8.2 | 82.6→75.8 ↓6.8 |
| 2 GPT + 1 Mistral | 74.6→72.4 ↓2.2 | 82.8→80.8 ↓2.0 | 93.4→93.0 ↓0.4 |
| 1 GPT + 1 Llama + 1 Mistral | 66.6→65.4 ↓1.2 | 57.8→63.4 ↑5.6 | 86.8→90.2 ↑3.4 |
单模型底线:GPT-4o-mini 在三套题上是 74.8 / 82.6 / 93.2,Llama-3.1-8B 是 57.0 / 55.6 / 76.4,Mistral-7B 是 41.6 / 34.0 / 34.2。三个 GPT-4o-mini 辩完,CSQA 仍是 74.8,跟单模型持平,辩论几乎没创造超额收益。三个 Llama 同构互辩,三套题全掉,说明伤害不只来自「混进一个更弱的」。
强模型占多数也挡不住弱模型。2 个 GPT-4o-mini 加 1 个 Mistral,三套题全微降。掉得最狠的是弱模型占多数:1 个 Llama 加 2 个 Mistral,MMLU 从 40.0 掉到 28.0,12 个点。GSM8K 偶尔涨,1 个 GPT-4o-mini 加 2 个 Llama 从 88.4 升到 92.8,三个模型混编从 86.8 升到 90.2。数学题有可核验的中间步骤,辩论有时真能纠错;常识和知识题没有,交换理由更容易把对的说成错的。
图 2 把转移拆开:原先就错的,大多数继续错(桃色段);真改口的人里,正确变错误(红)多于错误变正确(绿)。图 3 显示第二轮红段比第一轮更大。第一轮还能顶住的正确回答,第二轮更容易被同伴的不一致压垮。
图 4 按同意人数切片:一个同伴都不站在同一边时,正确→错误的翻转概率最高;同意的人变多,这条曲线往下走。GSM8K 上 GPT-4o-mini 和 Mistral 都比 Llama 更抗翻转。正确性 payoff 提示压不住这条曲线,不少格子里红段还变长了。口头说「你要答对」改变不了从众。
谁在生产里把几个不同尺寸的模型拼成辩论圈,这篇是直接的负结果。朴素 Du 式协议默认「多聊就会更好」,在 CSQA 上被打成十组全负。更省的基线是第一轮多数票,连第二轮的 token 都不用花。
数学类任务仍可能从交换理由里捞到几分,但不要把 GSM8K 上的涨点外推到常识和知识题。弱模型进场会污染强模型,哪怕强的是多数。Mixture-of-Agents 那套「差的输出也能当参考」在辩论设定里不成立。
要继续用辩论,至少得改协议:别把同伴输出写成 advice;给可信度或置信度加权;奖励独立核验,惩罚无依据附和。这篇没把这些招做出来,只把坑标出来了。
模型停在 GPT-4o-mini 和两个 7B/8B,没有前沿模型互辩。每套题 100 条,只报均值和标准误,没做显著性检验。主表 T=2,图 1 把准确率画到第 3 轮,轮次本身就不深。
对照只有「不辩论的多数票」,没有同等 token 预算的 self-consistency。多数票在 2 弱 1 强时结构上就偏向弱模型:两个弱模型一旦意见一致,强模型被否决。CSQA 是先前辩论论文没测过的任务,十组全负很大程度在打「泛化」,不一定否定 Du et al. 在算术上的正结果。
正确性 payoff 只写在 prompt 里,模型拿不到真奖励,失败说明不了 sycophancy 被排除,只说明这句提示没用。论文自己也说,单一机制解释不了失败,能力、任务、社会影响缠在一起。7 页 workshop 论文,干预实验到此为止。