Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
Kevin Murphy
cs.AI
2026-08-10
把 LLM 当假设提出器、贝叶斯方法(信息价值实验设计)当验证器,MDA 在 ForceBench/ChemBench/NeuronBench 上约 8 次实验到性能上限:化学符号准确率 56%,纯 LLM 到 60 次才 42%。
要回答「假如对系统做了 a 会怎样」这种干预式问题,光有能拟合观测数据的模型不够。两个机制可以完美解释所有历史数据,却在没见过的干预下给出截然不同的答案。能回答干预问题的,必须是机制性、因果性的模型,而不是一条曲线拟合。问题在于:被动数据定不出机制,只有干预、扰动系统看它怎么反应才能打破这种退化。但实验很贵(一次化验、一次临床试验),所以核心问题就是数据效率,用尽量少的实验把机制认准。
作者(Kevin Murphy,UBC)提出的 Model Discovery Agent(MDA)把 LLM 和贝叶斯方法分工:
作者的关键发现是「发现与设计互相强化」:设计步骤标定发现步骤提出的机制,被标定的机制改善预测,又让更细微的残差暴露出来,催生下一轮发现。一个生动的例子是汤川势(Yukawa)世界:屏蔽核在短距离上和幂律拟合几乎一样,只有把探针打到长距离才能让真相从近似里分出来。VoI 自动选了长距离探针,后验里真模型一下子落到复杂度-精度前沿的角上,作者叫它「aha 时刻」。
三个基准,B 不超过 8 次实验:
| 基准(领域) | 关键结果 |
| ForceBench(物理,DiscoverPhysics 的封装,6 个双粒子世界) | MDA 把便宜的 DeepSeek-v4 顶到接近 Opus 的精度,纯 LLM 智能体一直偏弱;纯 LLM 智能体要跑非节流模式约 41 次实验才到 nMSE 0.013 |
| ChemBench(化学,36 个任务) | MDA 约 8 次实验就到天花板,符号准确率约 56%;上一代 SOTA 的 LLM-AutoSciLab 跑到 60 次才 42% |
| NeuronBench(生物,新建,6 个 Hodgkin-Huxley 神秘神经元) | 贝叶斯预测器在每个世界上都打赢 in-context 预测器;随机设计最差 |
化学这一项有个反直觉的点要单独说:LLM-AutoSciLab 的符号回归(PySR)能拟合出 RMSLE 低到 0.001 的表达式,但那些是机制上毫无意义的嵌套 log 和拉伸指数。MDA 给的则是可解释的机制,底物抑制那项直接命中真形式。论文把这叫「高数值精度+低符号精度」的病态,正是纯拟合的典型坑。
NeuronBench 还有个随机版本(通道门控加了噪声变成 SDE,似然不可解析),需要粒子滤波近似,计算很重;作者用一维 CNN 学一个摘要统计量,把速度提了约 10 的 4 次方倍。
对 AI4Science 和自动化科学发现这条路,这篇给的分工很清楚:LLM 贡献的是「从先验里提假设」,贝叶斯方法贡献的是「量化不确定性、设计实验、给可解释模型」。两者都不是新东西,但拼在一起、并在 M-open 设定下能自我纠错地扩假设空间,是这个组合的核心价值。拿回的模型是可读的机制方程,不是黑箱曲线。
三个基准都是合成的(真模型已知),好处是能查符号等价,坏处是离真实湿实验室还远。预算 B 很小(≤8)。NeuronBench 是作者自建的,前两个是别人基准的封装。随机版本计算很重(SMC 里嵌套粒子滤波),工程上不轻。整体效果依赖 LLM 提假设的质量,M-open 的纠错也只是「扩一次池子」。单作者论文。