曝 DeepSeek-V4.1-Flash:552B 架构仅激活 8B,KV 缓存降 8 倍
bodonoghue85 · x · 2026-09-10
SemiAnalysis 发帖祝贺 DeepSeek 发布 DeepSeek-V4.1-Flash(第三方转述,未获官方确认),并给出架构细节:
- 552B 总参数骨干,采用因果编码器-解码器结构,prefill 仅激活 8B 参数,decode 激活 16B
- 引入 196B 的 Engram 记忆模块,通过稀疏查找访问
- 通过 bounded replay 机制,持久 KV 缓存比 V4-Flash 减少约 8 倍
若属实,这是一次以极端稀疏激活与 KV 压缩为核心的高效推理架构迭代。
所属事件:DeepSeek V4.1 Flash 爆料:552B 非对称架构对标 GPT-5.6(20 条相关)→
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11