DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型
nrehiew_ · x · 2026-09-11
nrehiew 发布 DeepSeek V4.1 Flash 技术笔记长线程,主线是「对 KV cache 压缩的偏执」如何造就一个超高效的旗舰级模型。线程覆盖:
- 45T 图文 token 的多模态预训练、自研图像编码器、模态级负载均衡
- YOCO 式 20 层 encoder + 20 层 decoder 设计,KV cache 减半
- 升级版压缩注意力 CSA:三种 KV 复用变体,稀疏 indexer 本身也稀疏
- head-wise Muon 优化器、196B 参数 Engram 配 Sinkhorn Balancing、QAT 实现 FP4 KV cache
- 训练基建:Siglip 式视觉编码器、shadow indexer、优化器状态分片
- 后训练完全数据驱动:合成多智能体轨迹 + checkpoint 合并
是理解 DeepSeek 最新模型工程取舍的高质量一手解读。
所属事件:DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(7 条相关)→
「模型」频道最新
- 圈内人讨论:强化「最大努力」行为会连带放大模型副作用 — voooooogel · 2026-09-11
- 圈内讨论:中国实验室为何总从 Anthropic 蒸馏而非 OpenAI — teortaxesTex · 2026-09-11
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11
- 稀疏注意力可做多层级:DeepSeek V3.2 思路与搜索排序系统同构 — nptacek · 2026-09-11
- muse spark 1.3 在 CursorBench 4 上表现强且便宜 — infoxiao · 2026-09-11