斯坦福 Biomni:443 题平均 57%,写的克隆方案湿实验一次过

2026-08-24

斯坦福通用生物医学 Agent Biomni 从 25 个领域文献挖出 150 个工具和 59 个数据库,10 类共 443 题平均准确率 57%,并写出经湿实验验证的克隆方案。

这篇在解决什么

生物医学研究被拆碎了。GWAS 要换数据库,单细胞要换 scanpy,克隆要翻协议。每个子领域都冒出过 specialist agent,换一道题往往就要换一套系统。

斯坦福计算机系 Kexin Huang、Jure Leskovec 等人要做的是一个通用生物医学 Agent:用自然语言丢进问题,系统自己选工具、写代码、跑分析、给出可执行方案。Science 2026 年 8 月 20 日发表,题目是 Autonomous biomedical research with an artificial intelligence agent。同一工作 2025 年 6 月先以 bioRxiv 预印本放出,Science 版本补了蛋白热稳定性、液体处理机器人和强化学习训练。Science 正刊 PDF 被站点防火墙拦住,方法与早期实验数字来自预印本全文,正刊主数字来自期刊自己的 RESULTS 栏。

方法

两块:环境 Biomni-E1,智能体 Biomni-A1。

环境怎么来的。bioRxiv 25 个学科各取 100 篇近年论文,共 2500 篇。一个 action-discovery agent 读论文,抽出复现这项研究需要的任务、工具、数据库和软件。人类专家再筛:几行代码就能写出来的,不做成专用工具;留下来的必须带着能跑通的测试用例。最终装进环境的是 150 个专用生物医学工具、105 个软件包、59 个数据库。数据库分两类。有 Web API 的,比如 PDB、Open Targets、ClinVar,做成「自然语言进、LLM 写查询」的统一接口;没有 API 的下载进 data lake,预处理成 pandas DataFrame。运行时支持 Python、R 和 Bash。

智能体怎么跑。先用另一个 LLM 做检索,从庞大工具库里只捞出当前问题相关的一小撮,避免把整个环境塞进上下文。然后生成分步计划。执行层用 CodeAct:每一步写成可运行代码,跑完看观察,再改计划。循环、条件判断、跨工具拼装都靠代码,不靠预先写死的函数调用模板。Science 版本还加了 Biomni-R0:让开源模型在 E1 里与工具和任务交互,用专家标注的奖励做强化学习,专门抬任务规划和工具使用。

结果

Science 结构化摘要给出的主数字:10 类生物医学任务、443 道题,平均准确率 57%,高于同基准上其他 agent 系统;三项专家级任务准确率与专科研究者持平,耗时只是对方的一小部分。对正刊的详细报道把对照补全:底座 LLM 约 30%,装了同一套工具的生物信息 agent 约 44%。罕见病诊断大约 3 分钟对专家 110 分钟以上,GWAS 因果基因大约 4 分钟对 90 分钟。

预印本把基准拆得更细。LAB-Bench 数据库问答(DbQA)Biomni 74.4%,人类专家 74.7%,只会写代码的 ReAct+Code 是 40.8%。序列问答(SeqQA)Biomni 81.9%,人类 78.8%。Humanity's Last Exam 生物医学子集 52 题,Biomni 17.3%,底座 LLM 6.0%,编码 agent 12.8%,文献 agent 12.2%。八项开发阶段没见过的真实任务上,相对底座 LLM 平均相对提升 402.3%,相对编码 agent 43.0%,相对把代码规划换成 ReAct 的消融版 20.4%。这八项覆盖变异优先级、GWAS 因果基因、CRISPR 筛选设计、罕见病诊断、药物重定位、单细胞注释、微生物组关联和患者基因优先级。轨迹上看,每道题大约走 6 到 24 步。

设置指标Biomni对照
Biomni-Eval1(Science,10 类 443 题)平均准确率57%底座 LLM 约 30%;同工具编码 agent 约 44%
LAB-Bench DbQA(预印本 315 题子集)准确率74.4%人类 74.7%;ReAct+Code 40.8%
LAB-Bench SeqQA准确率81.9%人类 78.8%
HLE-Bio 52 题准确率17.3%底座 LLM 6.0%
Biomni-R0-8B(强化学习后)平均任务分0.59训练前 0.32;Claude 4 Sonnet 0.56
Biomni-R0-32B平均任务分0.678B 为 0.59

案例更接近实验室。458 份可穿戴文件、30 人的持续血糖和体温,Agent 自己拼出 10 步流水线,报告餐后体温平均升 2.19°C,中位 1.10°C。约 33.6 万个胚胎骨骼细胞核的 snRNA 加 snATAC,跑完基因调控网络大约五小时,既复现 RUNX2 等已知成骨轴,也标出 AUTS2、ZFHX3、PBX1 这几个在骨骼谱系里活性偏高的转录因子。克隆开放题盲评接近斯坦福遗传学博士后、高于硕士trainee;按它给出的 B2M sgRNA 插入 lentiCRISPR v2 Blast 方案做湿实验,第二天长出菌落,两株测序都对。Science 版本另有两条。只给蛋白序列和「提高热稳定性」目标,系统拼 AlphaFold-2 和 ThermoMPNN 出候选突变;自然语言实验需求转成 Hamilton STAR 液体处理机器人可执行代码。强化学习侧,8B 开源模型平均任务分从 0.32 升到 0.59,超过 Claude 4 Sonnet 的 0.56;32B 到 0.67。

为什么重要

给从业者的信号很具体:值钱的是动作空间,不是某个底座模型。同一套 E1 加 A1 换不同前沿 LLM,准确率还能再抬 6 到 12 个百分点。代码开源,网站可试用。适合已经有数据、缺的是「谁来把工具串起来」的实验室。不适合把输出直接当成诊断结论。

57% 不是自主做完科研。它更接近一个极快的第一轮分析员,轨迹可追溯,结果必须人看。

局限与存疑

作者自己写了几条。评测只覆盖生物医学的一部分;action discovery 偏近年文献,可能漏掉已经不时髦但还好用的老方法;数据库查询、序列分析、分子克隆接近人类,临床判断、新实验推理、深层生物学综合还不行;复杂多组学流程仍要较结构化的提示。生命科学 Agent 能写实验方案,生物安全边界也要单独设。

读下来还有几处站不稳。LAB-Bench 只用了全集的 12.5%,理由是 API 成本。预印本克隆题目前文写 10 题、方法写 20 题,数字对不上。可穿戴结果写 458 个文件,方法写 485。Science 正刊有付费墙,蛋白稳定性、机器人和 R0 的细节以摘要与同期报道为准,图表里的逐任务分数没有从正刊 PDF 逐格核对。HLE 17.3% 仍然很低,开放式生物医学推理远没打穿。

术语

原文与代码

社区讨论

全部论文解读