无验证器进化法追平 AlphaEvolve,成本降到 ~1/3

Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution

Monishwaran Maheswaran, Leon Lakhani, Zhongzhu Zhou, Shijia Yang, Junxiong Wang, Coleman Hooper, Yuezhou Hu, Rishabh Tiwari, Jue Wang, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, Tri Dao, Xiaoxia Wu, Ben Athiwaratkun, James Zou, Chenfeng Xu

cs.AI, cs.CL

2026-04-09

多模型编排框架 Squeeze Evolve 把强模型留给初始化与硬组、便宜模型接其余环节,推理任务 API 成本降到 ~1/3 不掉点,并成为首个无验证器追平 AlphaEvolve 的进化方法。

这篇在解决什么

测试时算力扩展(test-time scaling)里有一支叫进化式推理:让模型反复采样,把较好的答案重组,再采样,几轮下来靠群体筛选逼近更优解。单模型做这件事有个老毛病。没有外部裁判纠正,几轮之后群体会塌缩到少数几种解法,多样性越走越窄,pass@K 反而往下掉。

要稳住多样性,此前的主流做法是挂一个验证器(verifier-based evolution),像 DeepMind 的 AlphaEvolve 那样用外部打分筛选候选。问题是验证器本身可能极贵。论文举的例子是某些科学发现任务里,验证一次要烧掉超过 1.2 亿 CPU 小时,很多领域根本没有现成的验证器可用。另一头,从头到尾只甩给一个最贵的闭源前沿模型做进化,输出 token 成本比同档开源模型贵 4 到 25 倍,很快就不经济了。

Squeeze Evolve 要同时啃下这两块:既不挂验证器,又不全程堆最贵的模型,还要把精度保住甚至推高。

方法

框架先把各种测试时扩展方法统一成一个进化循环:种群每轮靠「选择 + 重组」演化。统一形式本身不是重点,重点在于它把「该用哪个模型」做成了显式决策,分三块。

初始化用强模型。 实测显示,初始种群的质量基本决定最终重组结果的上限。在 HMMT 2025 上,强模型初始化配弱模型重组能到 89%,反过来只有 85%;AIME 2025 上这个差距拉到 23 个百分点(88% 对 65%)。所以最贵的模型只花在第一轮生成祖先种群上。

用模型自己的信号当适应度,给候选分组打分。 两个信号二选一。Group Confidence(GC)取 top-K token 的对数概率,高就是「这组模型更自信」,自打分几乎零成本,跨模型打分也只要一次 prefill;拿不到 logprob 的 API(比如 Gemini)就退而用 Group Diversity,即一组里最终答案有多少种不同的取值。两者都轻量,这正是它的卖点,也是最大的脆弱点(见局限)。

按适应度把组路由到不同档位的模型。 三档:已经达成共识的组直接多数投票,根本不进 LLM;自信或低多样性的「易」组交给便宜的 Model 1 重组;剩下的硬组才动用贵的 Model 2。阈值是按题目自适应算的分位数,不靠全局常数。这套路由能成立,靠一个反直觉的实测结论:当候选集本身够强时,弱模型也能当强聚合器。AIME 2025 上,零个正确种子的组聚合准确率是 0%,四个种子全对时升到 100%。种子质量决定重组成败,和谁来做重组关系不大,于是强候选组可以放心交给便宜模型。

系统侧两个配套设计。latency-matched serving 给快慢模型配不同大小的 GPU 池,让两档每轮墙钟时间相当,谁也不互相拖;一个自研的 Confidence Engine 在 vLLM 的 prefill 路径上直接在 GPU 累积置信度统计量,每次请求的传输量从约 13 MB 压到约 100 字节,打分延迟降到原来的 1/4 到 1/10。

结果

跨推理、代码、视觉、发现四类任务,整体降本 1.3 到 3.3 倍,固定 GPU 预算下吞吐最高快约 10 倍,精度多数持平或更高。代表数字:

任务单模型基线Squeeze Evolve降本
AIME 2025(Qwen3-30B)89.2% / $0.9490.7% / $0.661.4×
HMMT 2025(GPT-OSS-120B)89.7% / $0.4192.0% / $0.251.6×
GPQA-Diamond74.0% / $0.5775.9% / $0.321.8×
ARC-AGI-V2(Gemini 3.1 Pro)93.3% / $28.8597.5% / $7.743.7×
MMMU-Pro(Kimi-2.5)78.58% / $1.0479.06% / $0.462.3×

两个结果分量最重。ARC-AGI-V2 上 97.5% / $7.74 刷新了成本与能力的前沿,还压过用代码执行的 Imbue(95.1% / $8.71)。circle packing(n=26)这个科学发现任务上,Squeeze Evolve(GPT-OSS-120B + 20B)拿到 2.635896,略高于依赖验证器的 AlphaEvolve(2.635862),只比集成方法 ShinkaEvolve(2.635982)低一点点。这是论文反复强调的招牌:首个不挂验证器的进化方法,在发现任务上追平甚至超过挂验证器的。

多模态这边有个干净的结论。一个从不看图的纯文本便宜模型(Qwen3.5-35B)在 MMMU-Pro 上重组,反而比贵得多的视觉模型 Kimi-2.5 Thinking 略高(79.1% 对 78.6%),省 2.7 倍。原因是 loop 0 之后图像内容已经被强模型消化进候选,后续聚合不需要再看图。

整套路由只给端到端延迟加 2.4% 到 4.3%。

为什么重要

对从业者最直接的用法:做进化式推理不再需要先造一个验证器。在验证器昂贵或根本没有的领域(科学发现、开放式优化),这条路之前基本走不通,现在有了一个不依赖外部裁判还能追平有裁判方法的基线。工程上,强模型只做初始化和硬组、便宜模型接其余这个分工是可复用的启发,不绑死在这套框架里,自己搭 pipeline 时就能借鉴。混用开源和闭源模型也成了标配能力,按题目难度动态分配算力,而不是一刀切。

但要把它的分量看准。这是一篇把进化推理的成本与能力前沿整体往下推的工程与方法论文,不是在绝对精度上碾压所有基线。标准推理基准上的精度提升很小,真正的赢面在成本和吞吐。

局限与存疑

作者自己承认几点。路由依赖的适应度信号(置信度和答案多样性)是轻量但天然带噪的代理量;种群大小、组大小、循环轮数、路由阈值目前是按任务固定的,没有动态调整;整套方法作用在完整轨迹上,没有把推理拆成中间步骤做选择性重生成;什么时候模型自身置信度能可靠区分对错、有没有收敛保证,都还是开放的理论问题。

读完几处存疑。标准推理基准(AIME、HMMT、GPQA)上精度提升只有 1 到 2 个百分点,个别还略降(LiveCodeBench -0.3、闭源配对 GPQA -1.4、BabyVision -1.67),所以「不掉点」在单题层面并不总是成立,赢的是平均成本。「首个无验证器追平验证器」这块招牌基本压在 circle packing 一个任务上,而那个分 2.635896 对 AlphaEvolve 2.635862,差距在小数点后第五位,更接近打平而非超过。成本数字对所选模型对和定价高度敏感,换一套模型对比例未必成立。另外没有哪个模型对能在所有基准上通吃,落地时还得按任务挑。

术语

原文与代码

社区讨论

相关论文

全部论文解读