疑似 Qwen 新模型 n-gram 参数规模空前,前两层仅用 SWA

stochasticchasm · x · 2026-09-11

爆料者分析一个疑似 Qwen 系新模型的架构截图,指出其 n-gram(多词预测头)参数规模巨大,是迄今已知最大规模——此前 qwen-3.8-flash-next 为 51B n-gram 参数,该模型本身更大。

作者还注意到一个架构细节:前两层仅使用滑动窗口注意力(SWA)。他猜测 20 层中仅 2 层这样省的 prefill 算力不多,但「越局部越便宜」,背后可能有设计故事,或类似 MoE 中 first-k-dense 的思路。

所属事件:疑似 Qwen 新模型架构泄露:n-gram 参数规模空前(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →