DeepSeek-V4.1-Flash 重构架构:KV 缓存压缩至每 token 890 字节
AndLukyane · x · 2026-09-21
- 定位:DeepSeek-V4.1-Flash 针对 agent 类工作负载 redesign Transformer——编码/研究/工具调用 agent 反复处理数十万 token 而输出很少,prefill 算力与 KV cache 成为核心瓶颈。
- 架构:552B 参数 MoE,采用新的 Causal Encoder-Decoder(CED),40 层拆为 20 层因果编码器 + 20 层解码器;每 token 预fill 激活约 8B 参数、解码激活 16B。
- 缓存压缩:Compressed Sparse Attention 2(CSA2)跨层共享 KV 表示与稀疏注意力决策;SWA Bounded Replay 避免持久存储滑窗 KV;FP4 KV 量化把全局缓存压到每 token 仅 890 字节,约为 DeepSeek-V4-Flash 的四分之一。
- 能力保持:仍支持 1M token 上下文、原生视觉与强 agentic 能力;训练用 45T 多模态 token,大量提升来自自动生成的 agent 任务、环境与 rollout 的规模化。
「Infra」频道最新
- 双卡 R9700 本地推理踩坑:从 LGA1700 升级 Threadripper 的 PCIe 通道账 — El_90 · 2026-09-21
- Komlós 猜想被宣布解决,数学家点出其对神经网络量化的隐含意义 — stevenstrogatz · 2026-09-21
- 英伟达点名 5 家用 AI 做清洁能源的公司:电网评估从 45 天缩到 2 分钟 — nordicinst · 2026-09-21
- Mozilla 实测:本地 30B 模型零 API 全程自动开出真实 PR — mozilla-ai · 2026-09-21
- NVIDIA 盘点 5 家 AI 清洁能源公司:电网审核从 45 天缩到 2 分钟 — NVIDIA Blog · 2026-09-21
- Cohere Labs 推出 Local AI 社区计划,聚焦本地推理与硬件调优 — Cohere_Labs · 2026-09-21