UCL 团队提出 Large Discovery Models:让模型自己设计下一个实验

jiqizhixin · x · 2026-09-08

UCL Jun Wang 团队提出 Large Discovery Models(LDM),把基于模型的开放式搜索变成经验闭环:给定实验数据与基础模型上下文,在搜索空间上构建贝叶斯奖励信号,评估每个候选对下一轮实验的价值——要么表现更好,要么降低不确定性。架构分两层:快循环(从实验数据实时迭代)与慢循环(通过 post-training 将奖励信号蒸馏进基础模型)。结果:在 H100 上,相同初始条件下 LDM 的 BPB 降幅达纯 LLM 反思方法的 2.4 倍;换用 B200 后,LDM 主动扩大参数搜索空间,将 BPB 降至 0.902291,登顶 Auto-R 排行榜。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →