NVIDIA 论文:混合模型集成多数反而变差,单一模型家族最有效
omarsar0 · x · 2026-09-16
NVIDIA 团队研究了如何为多智能体系统选择模型,比较了八种选择策略(基于规模、准确率、答案多样性、错误多样性),在路由、多数投票、LLM-as-judge 三种设定下于高难度科学基准上测试。
关键发现:
- 扩大不同开源模型的池子提高了理论上限,但实际准确率常低于池中最好的单模型
- 使用同一个模型的多个副本效果更好
- 对最佳单模型做多数投票,把 HLE 准确率从 29.4% 提到 32.2%,而几乎所有混合模型组合都在下降
- 八种策略中,从同一模型家族内挑选候选模型的改进幅度最大
结论:在往 router 或 ensemble 里加模型前,先实测它能带来什么。
「研究」频道最新
- 复旦团队:LLaMA3-70B与Qwen25-72B可无人工干预自我复制 — hey_abusiddik · 2026-09-16
- 贝壳开源 PanoWorld:户型图驱动生成全屋一致 3D 全景 — rsasaki0109 · 2026-09-16
- 博主借 Wheeler 案警示:模型自评自测时「通过」意义存疑 — vishalmisra · 2026-09-16
- 从 Thompson 编译器攻击看 AI 评测:模型参与评测,验证即失效 — vishalmisra · 2026-09-16
- 普林斯顿 Hazan 撰文回顾在线凸优化二十年发展史 — HazanPrinceton · 2026-09-16
- 用实验室私有数据 RL 预测实验结果,杜绝网络预训练污染 — hsu_byron · 2026-09-16