深度探讨:注意力机制为何难以被替代

akbirthko · x · 2026-08-14

针对近期 Kimi 与 DeepSeek 论文在注意力机制(如 SWA 与 KDA)上的讨论,有研究者分析了为什么显式可寻址历史作为主要记忆机制在短期内难以被替代。

核心观点认为,只要大语言模型仍主要依赖互联网数据进行最大似然估计(MLE)以获取领域知识,注意力机制的变体就依然在发挥原有的作用。即使它们在序列长度上实现了对数深度(如关联扫描或分块并行),相对于真实世界时间,它们仍是固定深度的电路。

只有跨越了基于互联网数据的预训练阶段,进入序列扩展(如强化学习)阶段,模型才真正需要去处理上下文压缩、状态追踪和持续学习等复杂问题。在此之前,终端用户感知到的依然是一个有限的 token 缓冲区被填满再压缩的过程。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →