纯开源模型组队三层聚合,AlpacaEval 2.0 上 65.1% 压过 GPT-4o 的 57.5%

Mixture-of-Agents Enhances Large Language Model Capabilities

Junlin Wang, Jue Wang, Ben Athiwaratkun, Ce Zhang, James Zou

cs.CL

2024-06-07

提出分层 Mixture-of-Agents,每层多个 LLM 把上层全部输出当参考再作答;纯开源组合在 AlpacaEval 2.0 拿 65.1%,超过 GPT-4o 的 57.5%。

这篇在解决什么

开源大模型越出越多,每个都有自己的长处:有的擅长跟指令、有的擅长写代码,但没有一个能在所有题上都最强。问题来了:能不能不重新训练,只靠把这些模型「组队」,就得到一个比任何单模型都强的系统?

方法

Mixture-of-Agents(MoA,混合智能体)的做法是分层叠起来,通常三层。每一层有多个 LLM 智能体:

关键在「聚合」这一步:作者设计了一个提示词,让模型把多份参考答案合成一份,要求它批判性地甄别信息、剔除错误,而不是简单拼接。

模型分两种角色:提议者(proposer)擅长产出有用的参考答案,聚合者(aggregator)擅长把多份答案揉成一份高质量输出。作者通过实验挑出谁适合干什么。默认的开源组合用到 Qwen1.5-110B-Chat(末层聚合)、Qwen1.5-72B-Chat、WizardLM-8x22B、LLaMA-3-70B-Instruct、Mixtral-8x22B、dbrx-instruct,三层复用。

为了省钱还有个 MoA-Lite:只叠两层,因为第一层聚合带来的提升最大。

结果

配置AlpacaEval 2.0 LC 胜率
GPT-4o(0513)57.5%
GPT-4 Turbo(0409)55.0%
MoA(纯开源)65.1%
MoA + GPT-4o 当末层聚合65.7%
MoA-Lite(两层)59.3%

纯开源组合在 AlpacaEval 2.0 上比 GPT-4o 高出 7.6 个百分点。MT-Bench 上 MoA 配 GPT-4o 聚合拿到 9.40 分,超过 GPT-4 Turbo 的 9.31。FLASK 细分维度上,MoA 在正确性、事实性、洞察力、完整性上胜过 GPT-4o,代价是回答更长、不够简洁。

成本上,MoA-Lite 能在与 GPT-4o 持平的成本下质量更高,比 GPT-4 Turbo 性价比高约一倍;多个提议者可以并行跑,拉低延迟。

为什么重要

这是「不训练、只组队」路线的一个干净例证:在 AlpacaEval 2.0 这种强基准上,几个当时的开源 SOTA 叠起来能正面压过 GPT-4o。对预算有限、又不想被单一闭源模型卡脖子的团队,这条路在当时很有吸引力。代价也明摆着:要同时跑多个大模型,工程和算力开销不小。

局限与存疑

最大的痛点是首 token 延迟(TTFT)。必须等到最后一层跑完才能开始吐第一个字,因为最终答案依赖前面所有层的输出,交互体验会受影响。作者自己承认这一点,给出的缓解只是「少叠几层」和设想中的「分块聚合」,后者没实现。

结果强依赖 AlpacaEval 2.0 这一个基准,而这个基准本身就有冗长偏好、容易被刷分的问题(后来 LC 胜率就是为压制刷分改的)。MoA 倾向于产出更长答案,恰好撞上这类偏好,胜率里有多少来自「更长」、多少来自「更好」,论文没拆干净。

模型阵容是 2024 年中的开源 SOTA,放到现在很多已被超过;方法思路仍可迁移,但具体数字已不是当前最优。

术语

原文与代码

社区讨论

相关论文

全部论文解读