DeepSeek 发布非对称新架构:552B MoE,输入仅激活 8B
ChengleiSi · x · 2026-09-10
DeepSeek 官方公布新一代模型架构,主打「更多智能、更少成本」:
- 总参数 552B 的 MoE 架构
- 全新 Causal Encoder–Decoder(因果编码器-解码器)架构:输入端仅 8B 激活参数,输出端 16B
- 采用新预训练方法与更大规模的 RL 后训练,基准成绩超过包括 DeepSeek-V4-Pro 在内的旗舰模型
业内研究者评价其在 ProgramBench 上稳步提升,并预测「模型用 Rust 写出能跑的 FFmpeg 克隆只是时间问题」。非对称设计意味着读入便宜、写出略贵,贴合实际工作负载。
「模型」频道最新
- NeoHorse-1-4B 冲上 Hugging Face 热门,主打智能体与工具调用 — TokenRhythm · 2026-09-10
- 国产模型3D夜店实测:DeepSeek V4.1F氛围感碾压 — teortaxesTex · 2026-09-10
- DeepSeek 4.1 Flash现身Boeing榜:成绩未出 — victormustar · 2026-09-10
- Sentry CEO 实测:高阶订阅推理模型表现并不比常规旗舰强 — zeeg · 2026-09-10
- 最新模型已能熟练搞定 ffmpeg 音视频处理任务 — Flomerboy · 2026-09-10
- Astra 与 Fable 5.1 榜单几乎不重叠,基准分数其实没法直接比 — recro69 · 2026-09-10