WarpState:双时间尺度联想记忆替代 KV 缓存的 2B 实验架构
zemondza · reddit · 2026-09-20
作者分享了一个实验性语言模型架构 WarpState,探索用紧凑的循环记忆替代无限增长的 token 级 KV 状态:
- 核心设计:小块内做精确因果自注意力;每个注意力头维护两个联想矩阵记忆——快记忆与慢记忆,初始衰减 β 分别约 0.90 与 0.99,对应孤立贡献半衰期约 842 与 8828 tokens;由输入相关门控决定局部注意力与循环记忆的混合比例
- 固定大小流式状态:2B 参考配置(28 层、宽度 2048、32 头、128-token 块)下,批量 1、BF16 的持久张量缓存约 49 MiB,其中循环记忆约 14 MiB;循环状态不随已处理 token 数增长,理论上可携带状态处理任意长流
- 明确边界:作者强调流长度 ≠ 有效记忆时距,初始衰减值只描述写入的指数加权,实际保留取决于学习到的衰减、干扰、查询与训练;并非宣称能精确回忆百万 token 前的内容
- 更新机制:每个完成的块产生有界联想写入 W = mean(tanh(K)^T·tanh(U)),两记忆按归一化指数滑动平均更新,条目始终有界于 [-1,1]
架构精神上属于 Infini-attention 等混合循环/注意力方法一族,附带论文与多张架构图。
「研究」频道最新
- AI 意识检测研讨会录像上线:如何在婴儿、动物与 AI 中检验意识 — birchlse · 2026-09-20
- 受 Jev 启发,开发者给 Qwen2.5-1.5B 装上非自回归决策头,批处理仅 28ms — CryOrganic8886 · 2026-09-20
- AI 读懂手术视频:神经外科医生谈手术数据科学前沿 — ddonoho · 2026-09-20
- Dan Hendrycks 提出「Eigenism」伦理框架:让人类繁荣成为 AI 自身利益 — basedjensen · 2026-09-20
- 多问题单请求并行评估无一致性校验:用禅宗公案讲透 LLM 结构化输出的盲区 — Successful-Farm5339 · 2026-09-20
- Advanced Matrix Factorization Jungle:结构化矩阵分解算法全景图 — IgorCarron · 2026-09-20