信息论证明:基因组装不下一个生物体,DNA 是蓝图不是逐帧剧本

2026-08-01

信息论给出一条粗粒化阈值:基因组装得下细胞命运等功能集合,却比分子级精确数据小几个数量级,DNA 是生成蓝图,不是逐分子剧本。

这篇在解决什么

DNA 编码蛋白质一级序列这件事,1960 年代就解决了:给定一段编码区,对应的多肽链没有歧义。没有解决的是,同一段 DNA 怎么「长成」一个空间上井然有序、时间上精确配合的活物。一个细菌不是按比例混好的一袋蛋白;一个受精卵要分裂出几百种细胞、拼出固定的身体结构。从碱基到氨基酸的映射是清楚的,从基因组到生物体的映射并不清楚。

这篇预印本(Stanford 的 Kiiskinen、Rivas 与 Aalto 的 Kivinen,bioRxiv 2026.07)用信息论给这个老问题下了一个硬结论:生物体自身携带的信息,也就是基因组加上环境信号,根本不够把它的微观状态逐点指定下来。基因组是一份粗粒度的生成蓝图,不是一份逐分子编排的轨迹程序。

方法

作者把生物体建模成一个信息处理系统:一份静态的基因组 g、一路连续的环境输入 U、运行时的热噪声 W,加上一个对所有个体都一样的通用编译器(电磁、统计力学、化学等物理定律)和物理基底。两个公理撑起整个框架:状态容量有限,任一时刻物理状态最多承载 log2|Σ| 比特;以及马尔可夫因果局域性,信息只能经由相邻的物理状态一步步向前传,不能凭空跳到未来某一步。

核心是一个粗粒化阈值 C。把状态空间从粗到细切成不同分辨率,存在一个分界:比 C 粗的尺度上,基因组加环境的信息量够用,功能可以指定;比 C 细的尺度上,程序化微观决定不可能。这条阈值有两个互补的面:Shannon 面控制能否在预算内采样出集合,Hartley 面控制能否零误差地钉死唯一轨迹。

作者还堵了三个看似能逃生的漏洞。压缩程序加随机解码器这条路,搬进运行时随机数的比特一个都没省掉(Lemma 1)。用初始微观状态当种子,对扩散等快自由度不成立,初始信息在毫秒尺度上指数衰减(Lemma 1b 的混合引理)。DNA 不能当一块按时钟读取的延迟轨迹磁带,因为转录是由启动子识别、聚合酶可用性这些当下状态变量触发的,不是全局时钟(Lemma 2)。

要紧的是,论文只否定了程序化微观决定,即生物体自己的规约能否决定轨迹;不否定物理决定,即物理定律是否决定轨迹。物理世界照常决定论,只是这份决定论不写在 DNA 里。

结果

四个生物案例都落在阈值两边:功能性、粗粒度的描述比基因组预算低两到三个数量级,精确到分子坐标或逐帧轨迹的描述则超出预算。

案例功能性描述超出预算的描述
蛋白质折叠一级序列约 1300 比特 / 300 残基原子级三维结构约 5×10⁴ 比特 / 蛋白;E. coli 蛋白质组总量是基因组的 3 至 24 倍
E. coli拷贝数向量约 4.85×10⁴ 比特4nm 空间描述约 1.2 至 1.5×10⁷ 比特(基因组约 9.3×10⁶)
C. elegans连接组 4.37×10⁴ 比特、谱系 8.64×10³全程精确轨迹在 41.5 至 71.3 比特 / 细胞 / 分钟处越过基因组
DrosophilaBicoid 形态发生素每小时约 80 至 230 比特 / 核,够定 gap 基因命运不够定发育微观轨迹

计算验证在三套现成模型上复现了同一结构。跨 46 个物种的 AlphaFold-2 蛋白质组(55.5 万个蛋白)里,结构输出 38.5Gb 是编码输入 1.4Gb 的约 27 倍;即使把 AlphaFold 模型本身的参数代价只算一次,比例仍有 9 至 21 倍,而且蛋白组对外显子的比例跨物种几乎恒定在 21 至 30 倍。JCVI-syn3A 最小细胞的 4D 全细胞模拟中,空间寻址代价从一个细胞周期初的 60% 涨到末尾的 139%,在中期约 4300 秒处越过基因组预算。四个经典随机基因网络(爆发表达、压抑振荡器、拨动开关、MAPK 级联)里,生化层面的粗描述只要 8 至 16 比特,一旦细化到空间占位,状态空间就爆掉。

为什么重要

对做生物建模的人,这条结论直接框定了生成模型能做什么。AlphaFold、ESMFold、Evo 之所以能跨物种泛化,不是因为它们记住了每个物种的微观程序,是因为它们近似的是那个共享的编译器,也就是折叠、扩散、化学这些物理规律。论文据此给出一个判断:任何想从生物体内部复原一份主程序磁带的尝试都注定失败,因为这种磁带根本不存在;预测模型只能去逼近编译器式的输入输出映射。CRISPR、光遗传学这些工程干预也受同样的容量约束,它们能偏置通路、指定集合行为,但写不死下游的分子轨迹。

对遗传学,论文把遗传力和基因决定论区分开:遗传力衡量的是基因差异对某个粗表型变化的解释力,而那个共享的物理编译器可能因果上不可或缺、却在个体间几乎不产生方差,因此对遗传力估计几乎不可见。一个基因型可以高遗传力地预测一个粗表型,微观实现仍留着基因没指定的熵。

局限与存疑

这是一篇未经同行评审的预印本。不可能结论依赖两条公理和混合引理里那个一致 KL 收缩假设,论敌完全可以从这里入手。混合引理只对快自由度封死了「初始状态当种子」的漏洞,慢记忆(染色质、表观遗传)被算进当下状态、计入预算,这是建模选择而非证明。慢变量是否真的已被预算充分覆盖,作者承认需要后续工作。经验缺口是数量级的,阈值的确切位置依赖粗粒化方式和熵估计器的假设;随机网络和全细胞模拟里的空间描述有一部分是保守的组合构造,不是直接测量。最后,标题用「limits」是准确的:论文排除了程序化微观决定,没排除物理决定,读者若把它读成信息论否定了生物决定论,就过了头。

术语

原文与代码

社区讨论

全部论文解读