泄露架构疑似用全局共享 KV + 独立 SWA 换取超小 KV cache

stochasticchasm · x · 2026-09-11

作者讨论一个疑似泄露/新架构的设计:engram 规模是迄今所见最大的,传闻中的 qwen-3.8-flash-next 曾带 51B n-gram 参数(模型整体更大)。他推测「全局共享 KV + 各层独立 SWA(sliding window attention)」的组合是不错的折中——既能把 KV cache 压得极小,又让每层仍能看到新状态。属未证实的技术推测。

所属事件:疑似 Qwen 新模型架构泄露:n-gram 参数规模空前(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →