泄露架构疑似用全局共享 KV + 独立 SWA 换取超小 KV cache
stochasticchasm · x · 2026-09-11
作者讨论一个疑似泄露/新架构的设计:engram 规模是迄今所见最大的,传闻中的 qwen-3.8-flash-next 曾带 51B n-gram 参数(模型整体更大)。他推测「全局共享 KV + 各层独立 SWA(sliding window attention)」的组合是不错的折中——既能把 KV cache 压得极小,又让每层仍能看到新状态。属未证实的技术推测。
所属事件:疑似 Qwen 新模型架构泄露:n-gram 参数规模空前(2 条相关)→
「模型」频道最新
- 网传 DeepSeek v4.1 Flash 曝光,真实性待确认 — petrusenko_max · 2026-09-11
- Persimmon 团队亮相:数月研究成果开放研究预览申请 — niloofar_mire · 2026-09-11
- 付费用户吐槽:Astra 更聪明但额度消耗远超 Google 方案 — MickeySteamboat · 2026-09-11
- GPT Astra 实操 Dominions 6,挑战硬核 4X 策略游戏 — garden_frog · 2026-09-11
- Benchwarmer 工具上线:自动纠正误导性 AI 评测图表,重算胜者 — aronchick · 2026-09-11
- GPT-6 Astra 自主操控无人机穿越办公室追踪特定人类 — TheMoonMidas · 2026-09-11