曝 DeepSeek 正训练 2T 参数模型,远期规划直指 8T

Terminator857 · reddit · 2026-09-21

据转引的爆料,DeepSeek 正在训练一个 2 万亿(2T)参数的模型,并计划最终打造 8T 参数模型。作为参照,DeepSeek 现有模型中 Flash 为 552B 参数,Pro 为 1.6T 总参数、每 token 激活 49B 权重;传闻中的 Mythos/Fable 据估达 10T 参数。消息未获官方证实,但若属实将延续 DeepSeek 大 MoE 路线的激进攻势。

所属事件:爆料称 DeepSeek 训练 2T 参数模型并规划 8T(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →