NVIDIA测23模型:异构MAS扩大池子,HLE上常低于最强单模型

Mo' Models, Mo' Problems: How to best select model pools when designing Multi-Agent Systems

Sara Vera Marjanović, Jiacheng Xu, Aleksandr Laptev, Grigor Nalbandyan, Erik Arakelyan, Evelina Bakhaturina

EMNLP 2026

cs.MA, cs.AI

2026-09-15

23个开源模型、8种选池,在HLE等科学题上测路由、多数票和裁判。oracle上限随池变大上升,实际MAS常低于池内最强单模型,同家族是少数能打平或略超的做法。

这篇在解决什么

多模型系统现在有两条常用路。生成前用路由器挑一个模型回答;生成后把多家答案用多数票或 LLM 裁判收成一条。同类系统(同一底座、换 prompt 或多次采样)里,加 agent 往往单调变好。异构系统把不同家族、不同尺寸的开源模型塞进同一个池子,结果一直不稳定。

Hugging Face 上模型几百万个。MAS 该怎么从里面挑候选人,几乎没人系统测过。NVIDIA 这篇(EMNLP 2026,哥本哈根大学实习合作)把选池策略单独拎出来:它本身是不是设计变量。

方法

候选池 23 个开源模型,发布于 2024–2026,从 2B 到 1.6T,覆盖 Qwen3/3.5、Gemma 4、OLMo 3、Llama 3.1、gpt-oss、DeepSeek-v4、MiniMax,外加 4 个科学微调模型。每题每模型采 5 次。评测集是 Humanity's Last Exam(HLE)、GPQA-Diamond、Frontier Science–Olympiad。开放题用 gpt-oss-120b 判对错,和人工在 100 条子集上 93% 一致(Cohen's kappa 0.63),裁判偏松,会把错答判成对。

校准集 1.55 万题,来自 AOPS、Turing、Scale、Stack Overflow,相对排名和测试集高度相关(r>0.9)。

八种选池:按参数量(每家族只留一个)、按家族全收、让 GPT-5 Deep Research 挑、按 pass@1、按正确答案 Jaccard 距离、按选择题错误多样性,以及准确率各半混合两种多样性。池大小 k 取 3、5、10、15、20。

三种 MAS:

主指标是 ΔMAS Gain:系统相对池内最强单模型的增益,不是绝对分。这样比的是「组系统值不值得」,而不是「最强模型碰巧在不在池里」。

结果

模型信号先打掉几个直觉。准确模型做对的题高度重叠(Mantel rM=0.931),错题只弱相关(rM=0.384)。尺寸和准确率中等相关(Spearman rs=0.583)。Llama-3.1-8B 原版在物理、化学上全面压过同底座的 cosmosage 和 Chem-R,「专精微调」在这套科学推理题上并不专精,独有的做对题也均匀散在各学科,不是贴着微调领域长出来的。

Oracle 上限随 k 上升,按准确率或 GPT-5 推荐组池潜力最大,按错误/答案多样性组池上限最低。实际跑起来,图完全反过来:k 越大,相对最强单模型掉得越多。HLE 上只有同家族 MAS 还能超过池内基线,Gemma 4 相对最稳,OLMo 3 和 Qwen3 波动大。

同构单模型自己加采样是涨的。异构一加,多数票和裁判掉得比路由更陡。路由里只有 IoU 多样性和家族分组偶尔正增益。LLM 裁判在 HLE 上故意组的子集经常还不如随机组;GPQA 和 FS 上大约打平随机。Accuracy 组在 FS 上大约 +2 个百分点、GPQA 上不到 1 个百分点。

设置指标数字
最强单模型 HLEpass@129.4%
同构 majority@5HLE32.2%
同构 judge@5HLE36.5%
异构扩大 k相对最强单模型多数为负
裁判 vs 人工一致率93%(kappa 0.63)

为什么重要

给 MAS 工程一个能落地的结论:别把热门开源模型往池子里堆。同家族、能力接近、输出格式一致,比「越大越杂越好」更靠谱。路由需要的是可学的专长差,不是一堆都能答对同一批题的通才。这篇测的是简单 MAS,复杂编排、工具调用未必同样崩,但候选模型选择必须写进消融,不能默认「多即是好」。

同构系统随结构变复杂而涨分,异构系统随结构变复杂而掉分。现成的投票和裁判更像是给同源采样准备的,异构池可能需要另一套收束器。

局限与存疑

作者自己列了一串。只覆盖生成前/后,没有生成中协作。路由只试了一种。裁判上下文长度可能拖累大 k 的 GenSelect。工具和检索全关,科学题恰恰吃工具。家族分组无法对齐所有 k。任务限于科学推理。裁判偏松,会抬高绝对分。

正文几乎不给各策略的绝对准确率表,大量结论靠曲线。从业者很难直接复用「某个 k、某种选法」的具体分数。没有工具的科学推理,也可能放大了「答案空间被多样性污染」这件事。

术语

原文与代码

社区讨论

相关论文

全部论文解读