线性注意力在百万级 DNA 序列中召回率极低
No-Coffee-8227 · reddit · 2026-08-16
用户在研究 DNA 序列建模(长度可达 100 万 tokens)时发现,线性注意力虽然节省算力,但在长程召回上表现极差,在 Needle in a Haystack 测试中准确率仅 25%(随机水平)。即便是 HyenaDNA 等现有方案也面临类似问题。在 16K 短上下文中表现尚可(50-60%),但随上下文增长性能急剧下降。作者询问是否存在不依赖昂贵 Softmax 或外部内存的架构解决方案。
所属事件:线性注意力在百万级 DNA 序列召回率低(2 条相关)→
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24