基因组语言模型从头设计噬菌体,Science 论文造出 16 种有活性的合成噬菌体

2026-08-07

King 等人用基因组语言模型 Evo 生成完整噬菌体基因组,以 ΦX174 为模板合成测试近 300 条,得到 16 种有活性、且其鸡尾酒能克服耐药菌抗性的合成噬菌体。

这篇在解决什么

生物设计过去十年的进展基本停在单个基因或蛋白质的尺度。AlphaFold 预测结构、ProteinMPNN 设计序列、ESM 做蛋白语言模型,都在单分子层面。再往上到整个基因组,难度陡增:基因组里基因之间会重叠、调控元件相互牵制,一个突变就能让整条基因组失去活性。所以「从头设计一整条能工作的基因组」一直没人做成过。

这篇 Science 论文(King 等,通讯作者 Brian Hie,斯坦福)第一次做到了:用基因组语言模型生成完整的噬菌体基因组,并在实验里验证它们能感染细菌、能复制。噬菌体是感染细菌的病毒,基因组小、好做实验、又是潜在的抗菌疗法载体,是验证「全基因组设计」最合适的对象。

方法

团队用的是自己之前训的基因组语言模型 Evo 1 和 Evo 2。这类模型和文本语言模型同源,只是训练语料换成了一整库、覆盖所有生命域的数百万条 DNA 序列,让模型学到自然界写 DNA 的进化约束。

具体流程是:以天然噬菌体 ΦX174 为设计模板,目标宿主定为大肠杆菌 C。让模型生成大量完整的候选基因组,先用计算指标(序列合理性、编码完整性、与已知噬菌体的差异度)筛一遍,挑出有希望的化学合成出来,再放进宿主菌里测有没有活性。

关键在于这是「生成」不是「检索」,模型不是从数据库里抄一条已知噬菌体,而是按学到的约束写出新序列。作者还做了几轮条件生成,去引导生成的噬菌体保留宿主特异性。

> 注:受 Science 付费墙限制,下文的具体生成数量、筛选阈值、活性判定标准等细节来自论文的结构化摘要与编辑评述,正文方法与补充材料未能取得。

结果

作者生成了数千条候选基因组,化学合成并测试了将近 300 条,最终得到 16 种有活性的噬菌体。

这 16 种有几个突出特征:

最有应用意味的一组实验:把几种合成噬菌体混成「鸡尾酒」去对付已经对 ΦX174 产生抗性的大肠杆菌,这杯合成鸡尾酒能快速击穿抗性菌;而用同样思路混的天然 ΦX174 类噬菌体就做不到。这说明生成式设计能产出天然库给不了的、能绕开细菌抗性的噬菌体。

为什么重要

这是第一次有生成模型造出完整、可用、与自然序列明显不同的基因组。它把「生物设计」的尺度从单个蛋白推到了整条基因组。

对从业者(不管是 AI 还是合成生物)的信号:

局限与存疑

16/300 的成功率(约 5%)说明绝大多数生成基因组还是不能工作,全基因组设计的成功率仍然很低。论文用的是 ΦX174 这种已知最好理解的小型噬菌体(约 5400 个碱基)做模板,能否外推到更大、更复杂的基因组,论文说是「为更大基因组的生成设计奠定基础」,但没在这篇里做,仍是开放问题。

宿主只有大肠杆菌 C 一种,对其他细菌、对真核系统是否成立没有数据。

合成生物学和生成式 AI 结合会直接碰到生物安全:能生成完整、有感染性的基因组,这种能力天然是双用途的。论文引用了一批关于生成式生物 AI 安全治理的工作,但这篇本身的技术贡献大于它的治理讨论,治理部分更像是在标记风险。

正文方法、补充图表(Figs. S1 到 S30、Table S1)在付费墙后,上面的具体数字(生成数、筛选标准、活性判定)以论文结构化摘要和编辑评述为准。

术语

原文与代码

社区讨论

全部论文解读