A Hybrid Nested Harness for Decoupling Structure and Parameters in LLM-Driven Optimization
Víctor Gallego
COLM 2026
cs.LG, cs.NE
2026-08-08
LLM 会写代码结构但不会调连续参数。这篇把优化拆两层:LLM 提结构、CMA-ES 调数值,在三类任务上全面胜过纯 LLM 搜索与纯数值优化。
LLM 驱动的进化式优化(FunSearch、AlphaEvolve 那一类)里,一个冻结的 LLM 同时负责两件事:写代码结构(控制流、辅助函数)和定连续参数(阈值、学习率)。问题在于,LLM 写结构在行,调连续参数却很差,在一个试错循环里浪费大量 token 做离散跳跃,而传统数值求解器(CMA-ES)在连续优化上高效得多。一个工件把两种性质完全不同的决策混在一起,正是症结。
嵌套搜索(hybrid nested search)把优化拆成双层:
外层,冻结 LLM 提一个带数值「空位」的结构草图 τ,并为每个空位给出清单(manifest):上下界、类型(连续/整数/对数/2 的幂)、建议初值。内层,数值优化器把空位调到最优 θ(τ),最大化适应度 f(τ, θ)。内层是可插拔的:黑盒用 CMA-ES,可微用梯度法,要优化分布就用 MCMC(VI/NUTS)。结构按调优后的值 F̂(τ) ≈ maxθ f(τ, θ) 打分再决定是否保留(1+1 规则,或种群/GEPA)。
关键概念是「参数去混叠」。纯 LLM 搜索按 LLM 的未调优猜测 f(τ, θ̄) 给结构排名,一个好结构配上差猜测就被错杀。嵌套搜索按调优后的最优值排名,让 LLM 看到结构的真实潜力,优势正比于「调优间隙」E[Δ]。内层开销相对 LLM 调用可忽略。
三类任务,对比三种策略:纯 LLM 联合搜索、纯数值(固定结构)、本文嵌套。内层预算 100,目标函数对 LLM 保密。模型:Opus 4.8、GLM-5.2、Gemini 3.5 Flash。
| 任务族 | 代表结果 | 纯 LLM | 纯数值 | 嵌套 |
| 元优化器 | rastrigin(loss↓) | 19.2 | 9.95 | 1.22 |
| 云系统 | Cloudcast 跨云($↓) | 213 | 317 | 169 |
| 社会困境 | Cleanup 重负载(福利↑) | 0.480 | — | 0.582 |
| 贝叶斯推断 | gaussrot(VI, nats) | -33.4 | — | +4.30 |
元优化器上,嵌套在 ackley、rosenbrock 上把交付损失改善多达十二个数量级,在多模态 rastrigin 上甚至超过 oracle CMA-ES(1.22 对 9.95);ellipsoid 上两者持平。云系统策略上,跨云 Cloudcast 路由嵌套(169 美元,Gemini)胜过纯 LLM(213 美元)和纯 CMA-ES(317 美元),相对纯数值快 1.9 倍。Cleanup 这个序列社会困境上,嵌套在 9/9 的模型×种子组合上福利最高,三个模型在重负载下都收敛到 0.582;一个分段斜坡策略未调优时最差(福利 -0.10)、调优后却最好(0.582),纯搜索会把它扔掉改推 sigmoid、停在 0.480,约 21% 被混叠吃掉。贝叶斯推断上,内层换成 VI 或 NUTS:仿射高斯在 VI 下 +37.7 nats,NUTS 下漏斗 +3.12 个数量级(质量矩阵修不了的非线性,正是 NUTS 该赢的地方)。
这是一个干净、通用的分解,内外两层都可插拔,接口(清单)很轻,在多种优化器和多种 LLM 家族上都成立。它给联合 LLM 搜索的失败模式起了名字(参数混叠)并给了修法。在这些设置下内层开销相对 LLM 调用可忽略,对 LLM 驱动的发现管线是直接可用的改进。
内层开销「可忽略」的前提是每次评估便宜。一旦每次评估是一次完整训练(恰恰是 AlphaEvolve 那类场景),CMA-ES 动辄几十上百次评估就贵了,作者自己点明这点。外层用更复杂的文本优化器(GEPA)时,能自己回收大部分收益,内层的边际价值从约 1020% 缩到约 510%。结果都在基准上,真实科学发现的回报没有演示。