DeepSeek V4.1 Flash 多模态:45T 图文 token 预训练加模态级负载均衡
nrehiew_ · x · 2026-09-11
nrehiew 解读 DeepSeek V4.1 Flash 第一个架构差异——多模态:
- 用 45T 图文 token 预训练
- 自研图像编码器
- 模态级 load balancing
最后一点让人联想到原始 Chameleon 论文:不同模态的 token 可能相互竞争与干扰。
所属事件:DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(7 条相关)→
「模型」频道最新
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11
- 稀疏注意力可做多层级:DeepSeek V3.2 思路与搜索排序系统同构 — nptacek · 2026-09-11
- muse spark 1.3 在 CursorBench 4 上表现强且便宜 — infoxiao · 2026-09-11
- 用户盼 Haiku 3.5 回归:旧模型可被永久切断引不满 — repligate · 2026-09-11
- kalomaze:fable 5 部分问题出在后训练没做熟 — kalomaze · 2026-09-11