推算:DeepSeek 稀疏路线有望做到 40T 总参数、1T 激活

teortaxesTex · x · 2026-09-17

推文对前沿模型规模走向做算术推演:总参数 40T、每 token 激活 1T 应该就够用,而 DeepSeek 的稀疏化路线(含 Engram 记忆模块则 10T 总参)正朝着这个方向推进。作者认为依靠 supernodes(超节点)架构,serving 40T 总参数并不困难,再叠加合成数据与多模态,200T token 的训练数据量也不成问题,结论是超大稀疏模型「不可避免」。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →