湖南大学把基因组渲染成二维OCR文档,近二十倍压缩仍超过Enformer

Rethinking Genomic Modeling Through Optical Character Recognition

Hongxin Xiang, Pengsen Ma, Yunkang Cao, Di Yu, Haowen Chen, Xinyu Yang, Xiangxiang Zeng

ICML 2026

cs.CV, cs.AI, cs.CL, cs.LG

2026-02-02

湖南大学把基因组渲染成多页OCR文档,训视觉语言模型做长程调控预测。450kb eQTL九组织平均AUROC 0.852,超过Enformer的0.681,有效token近少20倍。

这篇在解决什么

基因组里真正干活的片段又短又跳,夹在大段低信息背景中间。HyenaDNA、Caduceus、Nucleotide Transformer 这类基因组基础模型把 DNA 当成一维 token 流,A/T/C/G 从左扫到右,归纳偏置直接从自然语言搬过来。基因组语义并不密,算力大量耗在背景碱基上,远距离的跳跃依赖也很难对齐到区间。

压缩本该是长序列建模的一等公民,但高保真压缩要先认出哪些区域值得留。现有模型仍按碱基或 k-mer 均匀记账。到 450kb 的 eQTL 输入时,NT-v2-500M 和 GENERator-1.2B 在这篇的设置里已经吃不下原生长度,只能切块再探针。生物信息日常要做的事(定位变异、取出子序列、补一段缺失)在纯序列范式里只能藏在位置编码里。

方法

湖南大学岳麓山实验室的 OpticalDNA 把基因组建模改写成 OCR 式文档理解。DNA 用等宽字体按行印到 640×640 画布,字号 14、行距 1.6,大约 1800 个碱基一页,印不下就翻页。页面上只有 A/C/G/T/N,不插坐标符号。每个碱基带着像素级框,序列区间和图像区域可以互相反查。这不是主张 DNA 生物学上是二维物体,只是把计算从「逐碱基扫」改成「按版面跳」。

视觉编码器沿用 DeepSeek-OCR 的 SAM–Conv–CLIP-L 前端并冻结:16×16 切 patch,卷积再把 token 降 16 倍,经 projector 对齐到解码器宽度。多页用一层 20 头自注意力融合,压成固定 100 个文档 token。解码器是 DeepSeek-3B 的 MoE,激活约 570M 参数,LoRA 微调。下游预测把解码器卸掉,只在编码器上接 256k 线性探针或 1.3M–2.3M 的浅 MLP。

预训练六个和基因组操作对齐的提示任务:整页转录、边读边定位、给定框读序列、掩码补全、子序列检索、染色体分类。HG38 上按 2048bp 窗口采样,8 张 H100 两阶段共 41.76 万步,大约 11 天;水稻用日本晴 T2T 基因组再训 15 万步,大约 5 天。

结果

主场是 DNALONGBENCH 的 eQTL,输入 450kb,九个 GTEx 组织报 AUROC。

方法可训练参数平均 AUROC
Enformer252M0.681
HyenaDNA1.6M0.514
Caduceus-Ph7.7M0.750
NT-v2-500M(切块)1.03K0.772
GENERator-1.2B(切块)10.24K0.782
JanusDNA7.7M0.791
JanusDNA MLP7.7M0.840
OpticalDNA 线性探针256K0.852
OpticalDNA MLP1.3M–2.3M0.867

渲染分辨率从 512 收到 1280,每页视觉 token 从 64 增到 400,压缩比 19.0 到 21.2,平均 AUROC 钉在 0.849–0.852。全血组织上 MLP 版 0.927,对照 JanusDNA MLP 的 0.821;甲状腺 0.876 对 0.793。

水稻侧另训一版 409M 编码器。剪接位点三分类 RiceSubBench 上,japonica 准确率 0.590 / AUROC 0.739,远分布的非洲栽培稻 glaberrima 0.599 / 0.731,均高于 Evo-2 7B(0.486 / 0.700 与 0.489 / 0.705)和 LucaOne 1.8B(0.510 / 0.703 与 0.526 / 0.736)。全基因组表型 RiceWGPB 用约 4 亿碱基预测千粒重和卷叶指数,RMSE 2.952 与 9.531,推理 12.3 分钟;Evo-2 是 3.056 / 9.617、5 小时 40 分。

相对未做 DNA 预训练的 DeepSeek-OCR,eQTL 平均 AUROC 从 0.823 提到 0.867。整页转录在完整长度上精确匹配 79.6%(HG38)和 74.9%(水稻),DeepSeek-OCR 约 1.2%。受控实验里同样 1 万 token、同一 Transformer,二维文档表示 0.626,一维序列 0.558。轻量 2D 骨干 TinyNet-E 平均 0.786,最强 1D CNN 变体只有 0.649。

为什么重要

长程调控和全基因组表型这类任务,瓶颈经常是背景碱基也要付完整注意力账。OpticalDNA 给出一条可复现的绕路:先无损印成文档,再用视觉压缩把有效 token 砍到约二十分之一,下游只调 256k 探针。对人基因组 eQTL 这一档长度,线性探针已经压过一串序列基础模型。

这是表示形式的换轨,不是新的生物学先验。下游更是把 OCR 解码器卸掉,真正干活的是视觉编码器加小头。已经在做超长基因组预测、愿意接渲染流水线的团队可以直接试;短序列分类或需要碱基级生成的场景,序列模型仍然更直接。

局限与存疑

染色体分类任务在 2048bp 窗口上准确率只有 0.062(HG38)和 0.104(水稻),作者承认短上下文不够辨染色体。转录任务靠近单页容量(1792–2048bp)时精确匹配掉到 42.3%。摘要里「985 倍更少激活参数」比的是 256k 探针和 Enformer 的 252M;冻结视觉编码器本身仍约 409M。附录里按碱基算的微调 FLOPs,OpticalDNA 是 177.76 MFLOPs/base,高于 JanusDNA 的 17.95 和 Caduceus 的 27.27,吞吐 0.12 M bases/s 也低于 Caduceus 的 0.52。所谓更省,主要省在有效 token 和对 Evo-2 这种 7B 序列模型的墙钟时间,不是对所有一维模型都更便宜。

RiceWGPB 只有 130 和 102 个品种,千粒重 RMSE 2.952 对 3.056,差距很小,样本量撑不起很强的全基因组结论。NT-v2 和 GENERator 因吃不下 450kb 被切块评估,对比并不对称。固定窗口排版会把皮下脂肪组织 AUROC 从 0.813 打到 0.758–0.774,表示对布局连续性格外敏感。预训练本身不便宜:8×H100 上人类基因组大约 11 天。

术语

原文与代码

社区讨论

相关论文

全部论文解读