非对称新架构:552B MoE 输入仅激活 8B,跑分超自家旗舰
deepseek_ai · x · 2026-09-10
DeepSeek 公布 V4.1-Flash 的架构细节,是其宣称跑赢旗舰的关键:
- 552B 参数 MoE,采用全新 Causal Encoder–Decoder(因果编码器-解码器)架构,激活参数高度非对称:输入仅激活 8B,输出激活 16B
- 结合新的预训练方法与更大规模的 RL 后训练,benchmark 成绩超过包括 DeepSeek-V4-Pro 在内的旗舰模型
所属事件:DeepSeek发布V4.1-Flash:552B MoE原生视觉,1M上下文MIT开源(26 条相关)→
「模型」频道最新
- 曝 DeepSeek V4.1 Flash 552B 参数发布,苹果折叠 iPhone 定价 1999 美元 — testingcatalog · 2026-09-10
- CoT 相似度检测显示 Qwen3.8 疑似用 GPT 5.5 思维链训练 — Chromix_ · 2026-09-10
- DeepSeek 新架构被指完全无视线性注意力,网友调侃引热议 — teortaxesTex · 2026-09-10
- 实测 GLM 5.3 Flash:写代码和查资料强,炒股和想点子差 — ManagementNo5153 · 2026-09-10
- 告诉agent预算有100万token,它竟多思考3-5倍 — paraschopra · 2026-09-10
- DeepSeek 新开源模型实测碾压 GLM 与 Kimi,便宜 4-10 倍 — deedydas · 2026-09-10