曝 DeepSeek 正训练 2T 参数模型,远期规划直指 8T
Terminator857 · reddit · 2026-09-21
据转引的爆料,DeepSeek 正在训练一个 2 万亿(2T)参数的模型,并计划最终打造 8T 参数模型。作为参照,DeepSeek 现有模型中 Flash 为 552B 参数,Pro 为 1.6T 总参数、每 token 激活 49B 权重;传闻中的 Mythos/Fable 据估达 10T 参数。消息未获官方证实,但若属实将延续 DeepSeek 大 MoE 路线的激进攻势。
所属事件:爆料称 DeepSeek 训练 2T 参数模型并规划 8T(5 条相关)→
「模型」频道最新
- 吐槽 xAI 重演套路:狂吹 Grok 4.7 却难产,圈内 hype 归零 — flowersslop · 2026-09-22
- xAI 修复 SDK 丢失推理内容的 bug,Grok 4.7 性能显著提升 — ns123abc · 2026-09-22
- Artificial Analysis 发布 TTS 全榜:xAI 87.6% 发音准确率居首 — ArtificialAnlys · 2026-09-22
- xAI 更新 SDK 后性能大增,冲进 Vals 榜单前十 — teortaxesTex · 2026-09-22
- Grok 4.7 价格不再便宜,第三方评测已贵过 Astra — steipete · 2026-09-22
- 8GB 显存 + 64GB 内存,哪款 LLM 最像「百科全书」? — Mangleus · 2026-09-22