2026-08-05
LLM-Blender 先用成对排序挑出每题最佳候选、再融合前三;配套 MixInstruct 基准,集成体 GPT-Rank 3.01 优于最强单模型 3.90。
2023 年开源指令模型井喷:Vicuna、OpenAssistant、Alpaca、MOSS、MPT 一大堆。作者的观察很直接:没有一个模型能通吃所有题。在他们收集的 5000 条指令上,最强的 Vicuna 也只在 21.22% 的例子里排第一。那么对每条输入,能不能动态挑出当下最该用的那个模型,甚至把几个模型的回答揉成一份更好的?
LLM-Blender 是一个「先排序、再融合」的两段式框架。
第一段 PairRanker 解决排序。此前的重排方法对每个候选单独打分(pointwise),但开源模型的回答质量普遍不低、彼此差距很细,单独打分很难分辨。PairRanker 改成把输入和一对候选一起送进交叉注意力编码器(DeBERTa,4 亿参数),让模型在同一次前向里直接比较两个候选孰优孰劣。N 个候选两两配对得到比较矩阵,再用 MaxLogits 聚合出整体排名。训练时对多种指标(BERTScore、BARTScore、BLEURT)做多任务学习,作者发现 BARTScore 与 GPT 排名的相关性最高,选它做监督。
第二段 GenFuser 解决融合。光选最好的候选,上限就是候选池里已有的最好那份。GenFuser 拿排名前三的候选,拼上原指令,用一个 seq2seq 模型(Flan-T5-XL,30 亿参数)生成一份新答案,取长补短。
为支撑评测,作者发布 MixInstruct:从四个指令数据集拼出 11 万条样本,跑 11 个开源模型各生成一份候选,并用 ChatGPT 对每对候选做比较得到「神谕」排名。
在 MixInstruct 测试集上(GPT-Rank 为主要指标,数字越小越好):
| 方法 | GPT-Rank | BARTScore | Top-3 命中率 |
| 最强单模型 OpenAssistant | 3.90 | -3.45 | 51.98% |
| Vicuna | 4.13 | -3.44 | 52.88% |
| PairRanker(只选最佳) | 3.20 | -3.14 | 65.12% |
| LLM-Blender(排序+融合) | 3.01 | -3.02 | 68.59% |
PairRanker 选出的答案平均排名 3.20,比最强单模型 3.90 提升约 18%(相对);加上 GenFuser 融合后进一步到 3.01。在与 ChatGPT 排名的相关性上,PairRanker 在 Pearson、Spearman 各项上都高于 BARTScore 等所有指标和其他重排器。
这是「LLM 集成」方向最早成体系的论文之一,给后来的 Mixture-of-Agents 之类工作铺了路。它的两个判断今天仍然成立:第一,开源模型各有擅长,不存在通吃者;第二,两两比对(pointwise 不行)比单独打分更能分辨细小差距。MixInstruct 也成了当时评测集成方法的事实基准。
效率是硬伤。要凑满比较矩阵,N 个候选两两配对是 O(N²) 次前向。作者用冒泡排序把复杂度降到 O(N),但承认这是在精度上做了让步;好处是这些比对彼此独立、可以并行。
评测高度依赖 ChatGPT 当裁判的 GPT-Rank,而且做比较时还把 ground truth 给了 ChatGPT 看(比常规做法信息更多)。可这正是同一个「LLM 当裁判」的范式,位置偏见等问题当时还没被系统揭发,排名里有多少水分不好说。模型阵容停留在 2023 年初的开源一代,现在看已严重过时;方法论仍可借鉴,具体数字不必当真。