DeepSeek 发布 V4.1-Flash:KV 压缩至 890 字节/Token,支持百万上下文
deepseek-ai · hf · 2026-09-18
DeepSeek 发布 DeepSeek-V4.1-Flash,一个面向长程 Agent 工作负载的多模态 MoE 模型,骨干 552B 参数,上下文最高 100 万 token,权重已在 Hugging Face 开放。
- 架构:采用 Causal Encoder-Decoder(CED),decode 时每 token 激活 16B 参数、prefill 时仅 8B,显著降低 agent 场景成本
- KV 缓存压缩:CSA2 跨层 KV 复用 + FP4 KV 缓存,全局 KV(常驻 HBM)仅 890 字节/token,约为 DeepSeek-V4-Flash 的 1/4;经 SWA Bounded Replay 部署优化后,SSD/主存持久 KV 降至约 1/8
- 性能:KV 足迹大减的同时表现优于基线;预训练语料 45T token(多模态),在文本与多模态 agent 场景表现强劲
所属事件:DeepSeek 发布 V4.1-Flash,552B MoE 支持百万上下文(4 条相关)→
「Infra」频道最新
- 内罗毕首届 Cafe Compute 聚会演示 Cerebras,呼吁推理层可解释性 — paw_lean · 2026-09-19
- Cerebras 用 Qwen 27B 打造购房理财助手 Money Agent — Alibaba_Qwen · 2026-09-19
- GPU 出租遭租客利用发起攻击,Clore.AI 拒不处理还封号 — anomaly256 · 2026-09-19
- 3M 曾赔 103 亿美元弃产 PFAS,AI 数据中心又把它做成增长市场 — aakashgupta · 2026-09-19
- 随机删缓存也行?研究揭示KV Cache驱逐机制被高估 — 机器之心 · 2026-09-19
- $250 淘矿卡魔改 30GB 显存,老 i7 主机跑 Qwen 达 30 tok/s — HFq_Dev · 2026-09-19