创智所与交大RiboSpan原生训满10240nt,长RNA冻结近邻分类达89%

RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling

Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu

cs.LG, q-bio.GN

2026-08-24

上海创智与交大放出16亿参数双向RNA模型,原生上下文10240核苷酸。一万长度全局重建准确率94.8%,长RNA冻结近邻分类89.1%,高于RNA-FM的81.0%。

这篇在解决什么

成熟 mRNA 经常超过 1000 nt,5′ UTR、CDS 和 3′ UTR 还会互相牵扯:改一段可能改掉另一段的折叠、稳定性和翻译效率。现有双向 RNA 编码器(RNA-FM、RiNALMo、AIDO.RNA)预训练窗口大约只有 1024 token,长序列只能截断。HydraRNA、RNAret 这类线性混合架构,以及 BiRNA-BERT 的 BPE 压缩,能把更长输入塞进去,但要么不再每层做核苷酸级 dense attention,要么丢掉单碱基分辨率。因果解码器 EVA 能生成长转录本,却读不到下游上下文。

缺口很具体:还没有一个模型同时做到单核苷酸分词、全层 dense 双向注意力、十亿参数,并且原生训到全长转录本尺度。位置插值和 YaRN 能在推理期拉长 RoPE,但预训练时模型没见过转录本级的远程交互。

方法

RiboSpan 是 32 层 pre-norm Transformer 编码器,隐层 2048、32 头、SwiGLU、全程 RoPE,参数量 1.61B。每个核苷酸一个 token,词表只有 16。数据来自 RNAcentral v26.0 和 Ensembl 115 / Ensembl Genomes 62,过滤去重后 6760 万条序列、857 亿核苷酸。训练用 Megatron-LM 做变长 packing:多条 RNA 塞进同一窗口,注意力在每条内部切断,位置编码在边界归零,避免 packed 序列串味。

对照实验把变量收得很死。同一套数据、同一套结构,分别训 1024 和 10240 两个窗口;先用 15% masking 预训练 6 个 epoch,再从该 checkpoint 用 40% masking 续训 2 个 epoch。高掩码这一档是为后面的离散扩散生成铺路。

生成侧把预训练骨干接到 AdaLN-Zero 条件扩散块上,用 MDLM 式 masked diffusion 同时改写 5′ UTR、CDS 和 3′ UTR。CDS 只允许同义密码子替换,氨基酸序列保持不变。性质预测加强化学习的闭环优化,论文写明要放到后续期刊,这篇没有实验数字。

结果

重建任务把上下文长度和掩码率拆开看。10,240 token、15% mask 时,原生 10K 模型的全局准确率 94.8%(10K-15),直接外推的 1K-15 掉到 93.1%,AIDO.RNA-CDS 是 91.6%。40% 重掩码时差距拉大:10K-40 达到 85.9%,1K-15 外推只有 77.2%。MLM loss 同一方向:10K-15 在 10,240 token、15% mask 下是 0.724,AIDO 是 1.151,1K-15 外推是 0.982。

长上下文基准更像一次受控探针。完整 mRNA 按 1024 到 10240 nt 分五档,每档 10 条;只重排中间约 1/32 长度的区间,碱基组成不变,周围序列不动。看三件事:干预区和背景区的表征有没有被拉开(ΔCS)、同类碱基跨区还像不像(Ccross)、远端没改的位置跟着变了多少(Ddistal)。

模型设置ΔCS↑Ccross↓Ddistal
RiboSpan-10K-15原生 10K0.4060.3030.0008
HydraRNA直接评0.3140.5220.0007
AIDO.RNA-CDSYaRN0.4460.3170.025
RiboSpan-1K-15YaRN0.4510.3340.016

YaRN 能把短窗口模型的区域分离拉回来,甚至略高于原生 10K,但远端扩散高一个数量级。HydraRNA 远端几乎不动,跨区分离也弱。原生 10K 把两头按住了。

冻结表征、不加任何下游头,用 leave-one-out 10-NN。25 类 biotype、89955 条 held-out 序列上,10K-15 准确率 89.9%,RNA-FM 86.5%,HydraRNA 86.1%。大于 1024 nt 的长 RNA 上,10K-40 到 89.1%,RNA-FM 只有 81.0%。Rfam 20 个高频家族上 RNA-FM 仍最高(99.0% 对 98.4%)。

为什么重要

做治疗性 mRNA 或全长转录本分析,现在多半还在 1K 窗口上切段。这篇把更贵的路跑通了:原生长窗口加单核苷酸 dense attention。更有用的是那套长程诊断。外推和 YaRN 都能把若干指标补回来,但补回来的交互会泄漏到远端。冻结评测说明表征本身已经按 RNA 类型排开,不一定先接一个任务头。生成框架目前只是方向声明,还不能当设计工具用。

局限与存疑

长上下文基准每档只有 10 条转录本,一共 50 条,统计功效有限。冻结分类用的是他们自己预训练的 held-out,不是独立公开基准,和 RNA-FM 的对比会偏向本模型的数据分布。生成、性质预测和 RL 后训练没有实验数字。稠密 10K 注意力的训练和推理成本几乎没报。HydraRNA 十二层里只有两层 attention,拿它代表全部高效长序列架构并不完整。

术语

原文与代码

相关论文

全部论文解读