曝 DeepSeek V4.1 Flash:552B MoE 非对称架构,智能超自家旗舰
_AndrewZhao · x · 2026-09-10
据博主 @sheriyuo 透露,DeepSeek V4.1 Flash 是一款 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构,输入输出不对称——输入激活仅 8B、输出激活 16B,成本显著低于同尺寸模型。
该模型还采用了新的预训练方式,并经过更大规模的强化学习后训练,基准测试中智能水平据说超越了包括 DeepSeek V4 Pro 在内的众多旗舰模型(消息未经官方证实,后续官方推文已证实发布)。
所属事件:曝 DeepSeek V4.1 Flash 为不对称激活 MoE,成本远低于同尺寸模型(2 条相关)→
「模型」频道最新
- 同一模型不同评测框架成绩悬殊,开发者呼吁标准化 harness 评测 — zainhas · 2026-09-10
- 曝 DeepSeek V4.1 Flash 为不对称激活 MoE,成本远低于同尺寸模型 — gaganghotra_ · 2026-09-10
- DeepSeek V4.1 Flash 实测:推理力度与输出质量近似线性扩展 — zainhas · 2026-09-10
- 从业者热议:一种全新架构的编码器-解码器模型问世 — antoine_chaffin · 2026-09-10
- DeepSeek V4.1 Flash 发布:552B MoE 骨干,支持百万 token 上下文 — tiguidoio · 2026-09-10
- DeepSeek 用 8 种 harness 配置评测 v4.1 flash:极简环境最强 — zainhas · 2026-09-10