DeepSeek V4.1 Flash 架构惊人:仅 20 层解码器,深度不及上代
teortaxesTex · x · 2026-09-10
网友 teortaxesTex 剖析新发布的 DeepSeek V4.1-Flash 权重,发现其架构出人意料地「浅」:严格来说只有 20 层 decoder(总计约 40 层),甚至比 V4-Flash 还浅 3 层,完全没有采用近来热议的 looped/递归 transformer 设计。
他还推算模型约为 5.6 Sol 量级。这种极浅架构配合其发布表现,引发了社区对 DeepSeek 架构取舍思路的讨论。
「模型」频道最新
- DeepSeek 新开源模型实测碾压 GLM 与 Kimi,便宜 4-10 倍 — deedydas · 2026-09-10
- Flash 小版本更新反超上代 Pro,DeepSeek 被劝专注小模型推理 — zephyr_z9 · 2026-09-10
- 截图显示 V4 时代 KV cache 机制存在 72 小时限制 — zephyr_z9 · 2026-09-10
- 用户称 OpenAI 叫停其蛋白质设计项目,转投开源权重模型 — Terminator857 · 2026-09-10
- 同一模型不同评测框架成绩悬殊,开发者呼吁标准化 harness 评测 — zainhas · 2026-09-10
- DeepSeek V4.1 Flash 实测:推理力度与输出质量近似线性扩展 — zainhas · 2026-09-10