WarpState 实验架构:双时间尺度联想记忆替代无限增长的 KV 缓存
zemondza · reddit · 2026-09-21
开发者发布实验性语言模型架构 WarpState(参考配置约 2.005B 参数、28 层、32 头、128 token 分块),探索用紧凑循环记忆取代不断增长的 token 级 KV 状态:
- 核心设计:每个注意力头维护快/慢两个联想矩阵记忆(初始衰减 β≈0.90 与 0.99,对应约 842 与 8828 token 的半衰期),衰减系数由模型学习;块内仍是精确因果 softmax attention,历史通过压缩循环状态查询,属于 Infini-attention 一类的混合架构。
- 固定大小流式状态:2B 配置 batch=1、BF16 下持久缓存仅约 49 MiB(循环记忆约 14 MiB),且不随已处理 token 数增长,可无限长流式推理。
- 关键澄清:作者强调流长度≠有效记忆时域,写入值被 tanh 约束在 [-1,1],更新为归一化指数滑动平均;实际保留能力取决于学习到的衰减、干扰与训练,文章附有图像与论文详解。
所属事件:WarpState 实验架构用双时间尺度记忆替代 KV 缓存(2 条相关)→
「研究」频道最新
- GNN 先学球体形变再零样本迁移,预测人类大脑皮层折叠 — bravo_abad · 2026-09-21
- 单张 H100 训练不到 10 小时:100M 参数文生图模型 Supra2-IMG 开源 — LH-Tech_AI · 2026-09-21
- Qwen 新模型与美团 LongCat 均用 N-gram 架构绕开 HBM 短缺 — bookwormengr · 2026-09-21
- 2 万条编码 agent 轨迹分析:69% 差评指向代码跑不通 — arena · 2026-09-21
- DeepMind、Meta、亚马逊联合发布 135 页 AI Agent 路线图 — mdancho84 · 2026-09-21
- DeliveryGym:在 UE5 巴黎送外卖,自适应 RL 让收入提升 54.3% — Lianhuiq · 2026-09-21