60 倍小模型打平 7B 巨兽:DNA 预训练数据对齐胜过规模
bravo_abad · x · 2026-09-09
一篇基因组语言模型的对比研究给出反直觉结论:110M 参数的小模型在寻找隐藏病毒 DNA 上几乎追平 7B 大模型,关键在于预训练数据是否来自正确的生物学领域。
- 任务:寻找 prophage(整合在细菌基因组内的病毒 DNA),被用作基因组语言模型的压力测试
- 对比对象:ProkBERT-mini-long(专在原核生物 DNA 上预训练的 BERT 类模型,约小 60 倍)vs EVO2(跨物种训练的 70 亿参数基因组模型)
- 结果:全基因组检测性能 0.700 vs 0.719,几乎持平
核心启示超越基因组学:在为科学领域构建基础模型时,先问预训练数据是否包含你想让它理解的那个世界——更好的领域对齐可能比堆参数更划算。
「研究」频道最新
- Counter-Swarm Doctrine:Hugging Face 事件后如何防范智能体协同入侵 — moltaicorp · 2026-09-09
- 无需成对数据训练 3D 编辑:用生成先验蒸馏替代监督学习 — Hao Wen · 2026-09-09
- 「AI by Arms」:Prof. Tom Yeh 用站起来伸展手臂讲透自编码器 — ProfTomYeh · 2026-09-09
- STARIT 预印本 v2:把空间转录组当图像,用视觉 AI 解析亚细胞异质性 — mo_lotfollahi · 2026-09-09
- 数据不够时模型越大越亏:学习曲线才是选模型的关键判据 — bravo_abad · 2026-09-09
- 社区发布 27B 无审查微调模型,用 Marchenko-Pastur 蒸馏训练噪声 — EvilEnginer · 2026-09-09