曝 DeepSeek V4.1 Flash 为不对称激活 MoE,成本远低于同尺寸模型
gaganghotra_ · x · 2026-09-10
转发链中流传 DeepSeek V4.1 Flash 的架构细节(未证实):称其为 552B 参数 MoE,采用全新 Causal-Encoder-Decoder 结构,输入输出激活不对称(输入 8B、输出 16B),成本显著低于同尺寸模型;并称其采用新预训练方式与大规模 RL 后训练,基准成绩超越包括 V4 Pro 在内的旗舰模型。注意:这些数字与官方/vLLM 披露的 769B 总参/15.5B 激活不一致,可靠性存疑,以官方发布为准。
所属事件:曝DeepSeek V4.1 Flash跑分:552B非对称MoE架构(12 条相关)→
「模型」频道最新
- 初步评估:智谱 V4.1 与 V4 环境相同、表现相近,后训练更精细 — xeophon · 2026-09-10
- Astra 对 DeepSeek V4 的技术预测与实际进展对照 — teortaxesTex · 2026-09-10
- 曝 DeepSeek V4.1 Flash 552B 参数发布,苹果折叠 iPhone 定价 1999 美元 — testingcatalog · 2026-09-10
- CoT 相似度检测显示 Qwen3.8 疑似用 GPT 5.5 思维链训练 — Chromix_ · 2026-09-10
- DeepSeek 新架构被指完全无视线性注意力,网友调侃引热议 — teortaxesTex · 2026-09-10
- 实测 GLM 5.3 Flash:写代码和查资料强,炒股和想点子差 — ManagementNo5153 · 2026-09-10