DeepSeek's official reveal of a new architecture: 552B MoE, only 8B active for input

zephyr_z9 · x · 2026-09-10

DeepSeek 官方预告新一代模型(被网友转发盛赞):- 非对称架构,「更智能、更便宜」;- 552B 参数 MoE,采用全新 Causal Encoder-Decoder 架构,输入仅激活 8B 参数、输出激活 16B;- 新预训练方法+更大规模 RL 后训练,基准成绩超越包括 DeepSeek-V4-Pro 在内的旗舰模型。官方表示将分 6 条推文陆续披露细节。

所属事件:DeepSeek开源V4.1-Flash:新架构原生视觉MIT协议(29 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →