线性注意力在 DNA 序列建模中的召回难题
No-Coffee-8227 · reddit · 2026-08-16
- 问题背景:在使用线性注意力处理长度达 100 万 token 的 DNA 序列时,遇到了严重的长程召回问题,在 Needle in a Haystack 测试中准确率仅约 25%(接近随机猜测)。
- 现象对比:尝试了 HyenaDNA 等现有方法,表现同样不佳;但在较短的 16K 上下文中,小模型的召回率可达 50-60%。这表明问题与上下文长度密切相关。
- 现有方案局限:大多数改进方案依赖外部记忆、滑动窗口机制或混合架构,作者希望寻找无需昂贵 Softmax 注意力或大型外部记忆的解决方案。
- 核心疑问:这是线性注意力压缩状态表示的根本局限,还是存在能够保持可靠检索的架构方法?
所属事件:线性注意力在百万级 DNA 序列召回率低(2 条相关)→
「研究」频道最新
- TSUI:编译 TS/XML 至 GPU 的原生框架 — johnlindquist · 2026-08-24
- Anthropic 研究:微调测谎仪在分布外失效 — PandaAshwinee · 2026-08-24
- 生数科技朱军发布通用世界模型五级路线图 — 生数科技 · 2026-08-24
- AGI 或率先诞生于硬科技:因数学与代码有明确反馈 — imjustnewatai · 2026-08-24
- 150 美元从零训练 15.7 亿参数 Dreamer 4 — OtherRaisin3426 · 2026-08-24
- 图工程协调多智能体系统,实现复杂任务管理 — Yuyuan Feng · 2026-08-24