WarpState 实验架构用双时间尺度记忆替代 KV 缓存
开发者发布实验性语言模型架构 WarpState,参考配置约 2.005B 参数、28 层、32 头、128 token 分块。核心设计是小块内做精确因果自注意力,用双时间尺度紧凑循环联想记忆取代无限增长的 token 级 KV 缓存状态,探索让模型以固定大小的状态处理长上下文,而非随序列长度线性膨胀。
2026-09-20 ~ 2026-09-21 · 2 条相关
- WarpState:双时间尺度联想记忆替代 KV 缓存的 2B 实验架构 — zemondza · 2026-09-20
- WarpState 实验架构:双时间尺度联想记忆替代无限增长的 KV 缓存 — zemondza · 2026-09-21