斯坦福团队实测:前沿LLM开箱注释DNA motif效果很差
斯坦福教授 Anshul Kundaje 于 9 月 24 日在讨论串中澄清,其团队关注的问题不是 motif 发现,而是给已发现的基因组序列 motif 做生物学注释——即它是什么、起什么作用、结合什么因子。团队实测用 Claude、GPT 辅助标注 DNA motif,其中 Opus 5 和 GPT6 的开箱效果都很差。Kundaje 认为这项极其费时费力的手工任务非常适合 AI 学习,属于需要专门训练的多模态推理任务,一旦训练到位即可解锁大规模 motif 词库的准确注释,团队正在为此积累足够标注数据。讨论串中还有两条相关信息:jatinn0 与 Kundaje 探讨用 LLM 破解 motif 注释瓶颈;研究者 Joseph Kellogg 观察到 Mythos 模型激活中存在与基因组语言模型(如 ESM 类 pLM/gLM)行为方向相似的 feature,jatinn0 据此提出假说——足够大且预训练含序列数据的 LLM 可能内化了某种序列理解能力。Kundaje 补充说团队并未接触过 Mythos。
已确认
- Kundaje 团队实测 Opus 5 与 GPT6 做 DNA motif 生物学注释,开箱效果都很差
- 讨论重点是 motif 的生物学注释而非 motif 发现
- 团队正在积累标注数据,目标是让模型学会准确注释大规模 motif 词库
- 团队没有接触过 Mythos
尚未确认
- jatinn0 关于「足够大且预训练含序列数据的 LLM 可能内化序列理解」仅为假说
- Kellogg 观察到的 LLM 与基因组语言模型激活方向相似性,尚待系统验证
为什么重要
- DNA motif 注释是基因组学的重大瓶颈,若 LLM 经专门训练能胜任,可显著加速基因调控研究
- 前沿模型开箱即用的差表现说明,专业生物任务仍依赖领域数据与专门训练,不能直接依赖通用模型
2026-09-24 ~ 2026-09-24 · 6 条相关
一手来源
- Kundaje 实测:Opus 5 与 GPT6 开箱做 DNA motif 注释都很差 — anshulkundaje ·
- Anshul Kundaje:LLM 经训练可破解基因组 motif 注释瓶颈 — anshulkundaje ·
- 研究者发现 Mythos 激活方向与基因组语言模型惊人相似 — jatin_n0 ·
- 斯坦福学者:Claude/GPT 标注 DNA motif 表现很差 — anshulkundaje · 2026-09-24
- 【源头】研究者发现 Mythos 激活方向与基因组语言模型惊人相似 — jatin_n0 · 2026-09-24
- 【源头】Anshul Kundaje:LLM 经训练可破解基因组 motif 注释瓶颈 — anshulkundaje · 2026-09-24
- 【源头】Kundaje 实测:Opus 5 与 GPT6 开箱做 DNA motif 注释都很差 — anshulkundaje · 2026-09-24
- 研究者热议用 LLM 破解基因组 motif 注释瓶颈 — jatin_n0 · 2026-09-24
另有 1 条近重复转述:anshulkundaje