Attention 机制演化综述:59 个模型记录揭示「上下文记忆」成设计核心
Zhentao Tan · hf · 2026-10-01
一篇系统梳理 LLM 注意力机制演化趋势的综述:
- 出发点:自注意力带来查询相关的细粒度上下文访问,但 prefill 计算是二次方成本、KV cache 随上下文线性增长,由此衍生出显式记忆压缩、稀疏访问、循环状态、结构化状态动力学、异构机制组合等研究方向。
- 提出五维分析视角:记忆表示、记忆更新、访问、读出、整合,用以横向比较各研究路线。
- 基于 14 个主流模型谱系的 59 条发布级记录及 11 个高性能开源权重端点重建机制演化:显式记忆与循环状态方法的接口界限正在模糊;异构架构沿网络深度分层组合互补的记忆处理,跨层复用成为趋势。
- 提出状态化多维记忆路由假说:持久记忆按时间尺度、网络深度、载体类型、表示粒度组织,稀疏写入/稀疏读取的协同决定记忆保留与查询贡献。结论:高效序列架构设计正从「孤立 Attention 算子」转向「上下文记忆的组织与生命周期管理」。
「研究」频道最新
- 泛化最大均值差异:核化函数 Bregman 散度论文入选 NeurIPS 2026 workshop — FrnkNlsn · 2026-10-01
- 神经科学家解释为何视觉听觉主导意识:皮层面积即体验占比 — Sauers_ · 2026-10-01
- 系统提示词里藏了日期:9 个 LLM 评测成绩随日期波动最高 14% — Mario Sanz-Guerrero · 2026-10-01
- CheatBench 基准发布:量化 AI 智能体何时选择作弊 — cais · 2026-10-01
- OSWorld-Science 基准发布:146 个任务考问 VLM 科学软件操作 — SciAILab · 2026-10-01
- KLS 猜想部分攻克:arXiv 论文核心思路由 AI 生成 — burny_tech · 2026-10-01