疑似 Qwen 新模型 n-gram 参数规模空前,前两层仅用 SWA
stochasticchasm · x · 2026-09-11
爆料者分析一个疑似 Qwen 系新模型的架构截图,指出其 n-gram(多词预测头)参数规模巨大,是迄今已知最大规模——此前 qwen-3.8-flash-next 为 51B n-gram 参数,该模型本身更大。
作者还注意到一个架构细节:前两层仅使用滑动窗口注意力(SWA)。他猜测 20 层中仅 2 层这样省的 prefill 算力不多,但「越局部越便宜」,背后可能有设计故事,或类似 MoE 中 first-k-dense 的思路。
所属事件:疑似 Qwen 新模型架构泄露:n-gram 参数规模空前(2 条相关)→
「模型」频道最新
- 网传 DeepSeek v4.1 Flash 曝光,真实性待确认 — petrusenko_max · 2026-09-11
- Persimmon 团队亮相:数月研究成果开放研究预览申请 — niloofar_mire · 2026-09-11
- 付费用户吐槽:Astra 更聪明但额度消耗远超 Google 方案 — MickeySteamboat · 2026-09-11
- GPT Astra 实操 Dominions 6,挑战硬核 4X 策略游戏 — garden_frog · 2026-09-11
- Benchwarmer 工具上线:自动纠正误导性 AI 评测图表,重算胜者 — aronchick · 2026-09-11
- GPT-6 Astra 自主操控无人机穿越办公室追踪特定人类 — TheMoonMidas · 2026-09-11