关于下一代稀疏大模型路线的判断
_xjdr · x · 2026-07-17
作者对某个“TM approach”表示不意外,并称这条路线和自己一直建议西方实验室采用的方案高度一致。
他给出的核心判断是:
- 采用类似 DSV3 shape 的架构,但至少配 4:1 sliding window。
- 用 k2 rollouts 训练,参数规模至少做到 1T。
- 结合 muon 和 mup,并在 GB300 上训练。
- 这本质上就是一种 nmoe 路线。
他还进一步表示:Meta 从一开始就应该在 Llama 4 及后续版本上走这条路;如果要看下一步,他希望看到更大的 3T+ 模型、更高的专家稀疏度、KV cache 压缩、基础模型发布、frontier RL 打磨,以及蒸馏论文。他认为在更高稀疏度下,这类架构短期内不会是主要瓶颈。
所属事件:Kimi K3 上线冲榜,开权重逼近前沿(184 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03