推算:DeepSeek 稀疏路线有望做到 40T 总参数、1T 激活
teortaxesTex · x · 2026-09-17
推文对前沿模型规模走向做算术推演:总参数 40T、每 token 激活 1T 应该就够用,而 DeepSeek 的稀疏化路线(含 Engram 记忆模块则 10T 总参)正朝着这个方向推进。作者认为依靠 supernodes(超节点)架构,serving 40T 总参数并不困难,再叠加合成数据与多模态,200T token 的训练数据量也不成问题,结论是超大稀疏模型「不可避免」。
「Infra」频道最新
- vLLM 深度优化 Kimi K3 推理:吞吐提升 2.2–2.8 倍 — vllm_project · 2026-09-17
- 黄仁勋罕见表态:预计英伟达明年芯片销量翻倍 — firstadopter · 2026-09-17
- AWS 官方对比 Bedrock 三种向量库:OpenSearch、pgvector 与 S3 Vectors — AWS ML Blog · 2026-09-17
- Baseten 优化 pyannote 说话人分离:吞吐提升 3.2 倍延迟降 9.6 倍 — baseten · 2026-09-17
- huggingface_hub v1.32.0 上线共享下载缓存,跨仓库复用 16.8GB 权重 — vanstriendaniel · 2026-09-17
- 富士通正式发布 MONAKA:144 核 ARM 数据中心 CPU — Fcking_Chuck · 2026-09-17