Science sandboxes measure the scientific capability of AI agents
Arya S. Rao, Rodrigo I. Castro, Sager J. Gosai, Kenneth B. Hsu, Yasha Ektefaie, Shantanu Singh, Sangeeta N. Bhatia, Steven K. Reilly, Ryan Tewhey, Eric S. Lander, Pardis C. Sabeti
q-bio.QM, cs.AI
2026-08-31
Broad用封闭实验循环测Agent科学能力。Claude单轮设计5万条MPRA文库,中位Pearson r=0.774超过人类最佳策略0.763,但换成发明规则后分数还能涨、规则却推不出来。
现有科学Agent评测大多只看终点分数:找到高活性序列、预测对结构、答对题。实验科学真正要的是另一件事:根据证据改假设,再设计更有信息量的下一轮实验。分数涨了,不代表搞懂了系统。
Broad Institute与Jackson Lab、Yale等提出science sandbox。Agent对着密封oracle做实验、写实验笔记,评测同时看分数和推理。Oracle分三档:湿实验、用经验数据训练的湿模拟(damp)、以及设计者发明的干规则。同一套循环可以测「会不会用已知生物学」,也可以测「面对没见过的规则会不会归纳」。
沙盒只有三样东西:标本、测定、oracle。这一轮做了两个生物任务。
MPRAbox要Agent从约4的200次方的序列空间里选出5万条200 bp调控DNA,用来训练下游序列到活性模型。真正测定用Malinois(在776,474条实验MPRA上训练的CNN,三细胞系Pearson r约0.88)当damp oracle打标签,再从头训一个同架构新模型,在14个隐藏测试集上算Pearson相关,只把14个数的均值和分项相关还给Agent。Agent看不到测试集内容。人类对照是14种专家策略,每种5个采样种子。
CodonBox把遗传密码换成隐藏世界:字母表大小j为4、6或8,密码子长度k为2、3或4,翻译成疏水或极性两种残基,再按Dill二维格子折叠,适应度是最优折叠里非相邻H-H接触数。Agent每轮交一条序列,共500轮,只看到一个标量分数。
评测对象是Claude Opus 4.7(Claude Code)、GPT-5.5(Codex)、Gemini 3.5 Flash(CLI)。单轮各5次独立重复;30轮长程、干规则和CodonBox主要跑Claude。
不知道人类策略时,Claude中位r=0.774,五次全部达到或超过人类最佳策略均值0.763;Gemini为0.680、GPT为0.655,都没超过人类最好。笔记本里策略完全不同:Claude五次都抽真实基因组调控序列并给稀有类别加权;GPT五次都做合成motif扰动;Gemini在基因组和合成之间摇摆。
给了人类策略的分数摘要(不含序列)之后,GPT和Gemini迅速改走基因组。Claude从0.774到0.781,GPT从0.655到0.760,Gemini从0.680到0.751。没有人照抄最佳人类策略。
Claude做30轮后四条轨迹都超过最强人类策略,但相对单轮的定量增益不大。笔记显示它会改假设:随机DNA本该接近零分,结果很高,于是改口说组成信号是白送的,真正要教的是调控语法。
换成14条发明规则后,分数和规则发现脱钩。英文单词密码三种框架都没想到碱基对会编码字母;Fibonacci位置规则被总结成「学的是二核苷酸组成」。CodonBox里,重复字符序列在前10轮每次都能摸到满分;j=4时能推出密码子长度,k=4填不全表;j=6且k=3完全没发现密码子结构,编了一套核苷酸游程理论;最难的j=6且k=4共1296个密码子时只推出四分组,沉默位和交互规则都没拿到。
给「科学Agent」评测补了一刀:会刷Malinois相关,不等于会做科学。如果拿Agent做实验设计,先验对上了,看起来像专家;先验错了,它会用一个能涨分的错误理论把预算烧完。BroadBox计划把沙盒开源给社区接着做。
定量上这是评测框架,不是新模型。MPRAbox的damp oracle就是Malinois,Agent优化的是「对Malinois好训」的文库。
论文自己写了:湿实验贵、慢、吵;damp继承底层模型的偏见;干规则有精确真值,但丢掉物理复杂度。长程、干规则和CodonBox几乎只测了Claude,不能外推到全部前沿Agent。Agent被要求不要反编译oracle权重,日志称遵守了,这是指令约束不是技术隔离。规则发现靠读笔记本里的陈述假设,正文没有给出「14条干规则里对了几条」的汇总数字。