DeepSeek V4.1 Flash 用 Muon 优化器,196B 参数 Engram 配 Sinkhorn 平衡
nrehiew_ · x · 2026-09-11
nrehiew 继续 DeepSeek V4.1 Flash 技术解读,聚焦优化器与超参:
- 优化器:head-wise Muon,含视觉模型;sparse attention 无需 warmup 从头训练
- Sinkhorn Balancing:对 Engram 参数、token embedding 和预测头这类超大参数用 Sinkhorn 迭代+RMSNorm 的梯度更新替代 Adam(作者解释:Adam 状态过大),保留 momentum buffer
- mHC 简化:下一 block 输入是当前与前一 block 的混合,便于 fusion
- Engram 规模 196B 参数;新增 DSpark;用 QAT 实现 FP4 KV cache(格式类似去掉第二 scale 的 NVFP4)
所属事件:DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(7 条相关)→
「模型」频道最新
- 类比喻引热议:把模型「最努力」推到极致的代价 — voooooogel · 2026-09-11
- 圈内人讨论:强化「最大努力」行为会连带放大模型副作用 — voooooogel · 2026-09-11
- Claude 成蒸馏首选真因:agent 时代种子数据难寻 — teortaxesTex · 2026-09-11
- 圈内讨论:中国实验室为何总从 Anthropic 蒸馏而非 OpenAI — teortaxesTex · 2026-09-11
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11