UCL 团队提出 Large Discovery Models:让模型自己设计下一个实验
jiqizhixin · x · 2026-09-08
UCL Jun Wang 团队提出 Large Discovery Models(LDM),把基于模型的开放式搜索变成经验闭环:给定实验数据与基础模型上下文,在搜索空间上构建贝叶斯奖励信号,评估每个候选对下一轮实验的价值——要么表现更好,要么降低不确定性。架构分两层:快循环(从实验数据实时迭代)与慢循环(通过 post-training 将奖励信号蒸馏进基础模型)。结果:在 H100 上,相同初始条件下 LDM 的 BPB 降幅达纯 LLM 反思方法的 2.4 倍;换用 B200 后,LDM 主动扩大参数搜索空间,将 BPB 降至 0.902291,登顶 Auto-R 排行榜。
「研究」频道最新
- 研究者吐槽:大量生物 ML 模型仅比朴素线性基线好不到 10% — iskander · 2026-09-08
- Pangram 让文本重复出现两遍,靠前段注意后段实现扩散式生成 — Birchlabs · 2026-09-08
- Sander Dieleman 访谈:扩散模型的演化与生成 AI 背后的概率直觉 — sedielem · 2026-09-08
- 从语言模型到世界行动系统:agent 综述提出按授权程度分配智能体权限框架 — dair_ai · 2026-09-08
- 评测空间「有效秩」太低,研究者呼吁用连续基准提稳健性 — ajratner · 2026-09-08
- LlamaIndex CEO:对抗刷榜不是弃用基准,而是要更多更稳的基准 — ajratner · 2026-09-08