60 倍小模型打平 7B 巨兽:DNA 预训练数据对齐胜过规模

bravo_abad · x · 2026-09-09

一篇基因组语言模型的对比研究给出反直觉结论:110M 参数的小模型在寻找隐藏病毒 DNA 上几乎追平 7B 大模型,关键在于预训练数据是否来自正确的生物学领域。

核心启示超越基因组学:在为科学领域构建基础模型时,先问预训练数据是否包含你想让它理解的那个世界——更好的领域对齐可能比堆参数更划算。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →