Mixture-of-Agents Enhances Large Language Model Capabilities
Junlin Wang, Jue Wang, Ben Athiwaratkun, Ce Zhang, James Zou
cs.CL
2024-06-07
提出分层 Mixture-of-Agents,每层多个 LLM 把上层全部输出当参考再作答;纯开源组合在 AlpacaEval 2.0 拿 65.1%,超过 GPT-4o 的 57.5%。
开源大模型越出越多,每个都有自己的长处:有的擅长跟指令、有的擅长写代码,但没有一个能在所有题上都最强。问题来了:能不能不重新训练,只靠把这些模型「组队」,就得到一个比任何单模型都强的系统?
Mixture-of-Agents(MoA,混合智能体)的做法是分层叠起来,通常三层。每一层有多个 LLM 智能体:
关键在「聚合」这一步:作者设计了一个提示词,让模型把多份参考答案合成一份,要求它批判性地甄别信息、剔除错误,而不是简单拼接。
模型分两种角色:提议者(proposer)擅长产出有用的参考答案,聚合者(aggregator)擅长把多份答案揉成一份高质量输出。作者通过实验挑出谁适合干什么。默认的开源组合用到 Qwen1.5-110B-Chat(末层聚合)、Qwen1.5-72B-Chat、WizardLM-8x22B、LLaMA-3-70B-Instruct、Mixtral-8x22B、dbrx-instruct,三层复用。
为了省钱还有个 MoA-Lite:只叠两层,因为第一层聚合带来的提升最大。
| 配置 | AlpacaEval 2.0 LC 胜率 |
| GPT-4o(0513) | 57.5% |
| GPT-4 Turbo(0409) | 55.0% |
| MoA(纯开源) | 65.1% |
| MoA + GPT-4o 当末层聚合 | 65.7% |
| MoA-Lite(两层) | 59.3% |
纯开源组合在 AlpacaEval 2.0 上比 GPT-4o 高出 7.6 个百分点。MT-Bench 上 MoA 配 GPT-4o 聚合拿到 9.40 分,超过 GPT-4 Turbo 的 9.31。FLASK 细分维度上,MoA 在正确性、事实性、洞察力、完整性上胜过 GPT-4o,代价是回答更长、不够简洁。
成本上,MoA-Lite 能在与 GPT-4o 持平的成本下质量更高,比 GPT-4 Turbo 性价比高约一倍;多个提议者可以并行跑,拉低延迟。
这是「不训练、只组队」路线的一个干净例证:在 AlpacaEval 2.0 这种强基准上,几个当时的开源 SOTA 叠起来能正面压过 GPT-4o。对预算有限、又不想被单一闭源模型卡脖子的团队,这条路在当时很有吸引力。代价也明摆着:要同时跑多个大模型,工程和算力开销不小。
最大的痛点是首 token 延迟(TTFT)。必须等到最后一层跑完才能开始吐第一个字,因为最终答案依赖前面所有层的输出,交互体验会受影响。作者自己承认这一点,给出的缓解只是「少叠几层」和设想中的「分块聚合」,后者没实现。
结果强依赖 AlpacaEval 2.0 这一个基准,而这个基准本身就有冗长偏好、容易被刷分的问题(后来 LC 胜率就是为压制刷分改的)。MoA 倾向于产出更长答案,恰好撞上这类偏好,胜率里有多少来自「更长」、多少来自「更好」,论文没拆干净。
模型阵容是 2024 年中的开源 SOTA,放到现在很多已被超过;方法思路仍可迁移,但具体数字已不是当前最优。