Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
Zhongwei Yu, Yan Song, Xue Yan, Anjie Liu, Xingyu Lu, Yihang Chen, Huichi Zhou, Siyuan Guo, Luoyang Sun, Sihan Chen, Xiangning Yu, Jun Wang
cs.LG
2026-08-16
把 LLM 生成候选和高斯过程代理的获取函数耦合成闭环,在神经网络训练程序搜索、抗体设计、分子优化三个领域全面超过纯 LLM 反思和纯贝叶斯优化,分子任务 Pareto 超体积提升 62.4%。
科学发现里大量问题的评价贵得离谱:合成一个分子、测一次抗体结合能、跑一次训练,都要真金白银和时间。推理时代的 LLM 搜索(树搜索、best-of-N、过程验证器)在数学和代码上大杀四方,前提是验证便宜且可重复。到了科学场景,这套前提塌了:LLM 自己的似然和自评既不跟踪外部实验指标,也不给出校准的不确定性,对训练分布外的新候选尤其不可靠。
另一条老路,贝叶斯优化(BO),用高斯过程代理模型在有限观测下做不确定性感知的实验分配,样本效率高,但它需要一个预先定义好的设计空间表示和搜索算子,在分子、蛋白质、程序这类开放式组合空间里寸步难行。两条路各有半块拼图:LLM 能提出结构化候选但不知道哪个值钱,BO 知道哪个值钱但提不出候选。
Large Discovery Model(LDM)把两半拼上,三个组件构成循环:
数学核心是一个 KL 正则化的变分目标:找一个既靠近 LLM 先验、又最大化期望获取值的搜索分布。它的闭式解是获取函数指数倾斜后的 LLM 分布。两个极端退化为已知范式:倾斜强度为零就是纯 LLM 采样,先验趋平就是经典 BO,LDM 活在两者之间。实践上用有限池近似:每轮让 LLM 生成 N 个候选,按获取值 softmax 重加权或取 top-b送去评估,观测回来后更新 GP 和上下文,进入下一轮。
一个关键设计是「发现」与「探索」的区分。代理模型不确定性高但能表达的候选只是已知未知;改变搜索支撑本身、把之前表达不出来的设计家族带进来,才是发现。LDM 靠让 LLM 动态重构参数化空间实现这一点:训练程序搜索里检测到平台期,就反思并扩出新的搜索维度。理论部分给了遗憾界分解:总遗憾 = 发现缺口(LLM 储库没覆盖到优质区域)+ 常规 GP-UCB 优化误差 + 采样自倾斜分布而非精确最大化的损失。
还有一条慢学习回路:把高预算搜索过程积累的候选和获取值记录成数据集,带获取权重地微调一个小模型,把搜索策略蒸馏进权重。监督信号是获取值而非奖励值,教的是「下一步实验值不值得做」的策略判断。
三个领域,同一套框架:
| 任务 | LDM | 最强基线 | 说明 |
| 训练程序搜索(nanoGPT,val bpb) | 降到 0.9342 | LLM-only 0.9767 | 同 H100 五分钟预算,降幅 0.0727 vs 0.0301,2.4 倍 |
| 抗体 CDRH3 设计(5 靶点平均) | -104.1 至 -113.1 | AntBO -92 至 -113.6 | 200 次评估预算,与专用方法打平 |
| 分子多目标优化(KRAS G12D 超体积) | 27.3 | 纯 LLM 16.8 / MOBO 16.8 | 提升 62.4% / 63.1% |
消融把三个部件逐一拆开验证:测试时搜索预算从 4×4 加到 8×8,性能上升;去掉发现机制、固定特征集,收敛到更差的平台;只用后验均值不用不确定性感知获取函数,早期持平后期落后。纯 LLM 研究循环(无代理、无获取值)在 875 次实验后停在 0.956,瓶颈不在生成能力在价值信号。蒸馏实验里,微调后的 Qwen3.5-9B 在抗体任务上追平 Qwen3-Coder-30B 的参考线,且在从未见过蛋白质任务的迁移测试中保持了五分之四靶点的水平。
对做 AI for Science 的人,这篇给出了一个可抄的架构模板:LLM 不该被当成全知的研究员,该被当成有结构先验的候选生成器;价值判断交给外部校准的统计模型。三个领域共用同一套获取逻辑,只在核函数和特征表示上动手脚,说明这个分工有普适性。蒸馏部分还展示了一条降本路径:高预算搜索攒下的经验可以内化到小模型,推理成本随之下降。
自回归式的进展叙事(生成→推理→发现)背后是一个具体判断:推理时代靠便宜验证器撑起来测试时算力扩展,发现时代要靠昂贵的经验反馈撑,价值信号的校准成为新的瓶颈。这个判断有 Gupta 等人和 Kristiadi 等人的反面证据背书:LLM 在 BO 任务里对实验反馈不敏感、点估计的不确定性不可靠,所以 LDM 刻意不让 LLM 自己估计价值。
作者自己列的:GP 精确推断对观测数是立方复杂度,大实验预算下撑不住;测试时搜索靠批量采样,LLM 推理开销不小;每个领域的核函数和特征表示仍要手工定制;LLM 预训练知识弱的领域(抗体序列先验就弱)难以显著超过专用方法;闭环只用了过程内观测,外部数据库和历史文献这批「未知已知」完全没用上。
读下来的补充存疑:三个案例的评价都是数字oracle(Absolut! 模拟器、AutoDock 打分、固定训练预算),与真实湿实验室的噪声和漂移还有距离,作者也承认湿实验验证是未来工作;「2.4 倍」这类倍数是相对 LLM-only 基线的绝对降幅比,分母不大,宣传时容易显得比实际夸张; regret 分析里的储库质量假设(近优候选的质量下界)在真实 LLM 上是否成立没有实验验证。