斯坦福团队实测:前沿LLM开箱注释DNA motif效果很差

斯坦福教授 Anshul Kundaje 于 9 月 24 日在讨论串中澄清,其团队关注的问题不是 motif 发现,而是给已发现的基因组序列 motif 做生物学注释——即它是什么、起什么作用、结合什么因子。团队实测用 Claude、GPT 辅助标注 DNA motif,其中 Opus 5 和 GPT6 的开箱效果都很差。Kundaje 认为这项极其费时费力的手工任务非常适合 AI 学习,属于需要专门训练的多模态推理任务,一旦训练到位即可解锁大规模 motif 词库的准确注释,团队正在为此积累足够标注数据。讨论串中还有两条相关信息:jatinn0 与 Kundaje 探讨用 LLM 破解 motif 注释瓶颈;研究者 Joseph Kellogg 观察到 Mythos 模型激活中存在与基因组语言模型(如 ESM 类 pLM/gLM)行为方向相似的 feature,jatinn0 据此提出假说——足够大且预训练含序列数据的 LLM 可能内化了某种序列理解能力。Kundaje 补充说团队并未接触过 Mythos。

已确认

尚未确认

为什么重要

2026-09-24 ~ 2026-09-24 · 6 条相关

一手来源

另有 1 条近重复转述:anshulkundaje