DeepSeek V4.1 Flash 基建细节:Siglip 式视觉编码器与稀疏 indexer 集群
nrehiew_ · x · 2026-09-11
nrehiew 解读 DeepSeek V4.1 Flash 的训练基建:
- 视觉编码器:Siglip 风格,关键洞察是一个模态计算时可以并行 all-gather 另一模态的特征;对超长多图序列应用 CP(context parallelism)
- CSA 2 配套:shadow indexer 只做计算、从 master 副本拉取更新权重(类似 RL 的推理 worker);还有 pipeline payload extensions(跨 pipeline stage 的元数据)
- 优化器状态分片:跨 Engram 表分片,Engram 位于浅层使视觉编码器运行时可 prefetch
所属事件:DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(7 条相关)→
「Infra」频道最新
- k3报告细节:数百万并发沙盒的RL训练规模确认 — stochasticchasm · 2026-09-11
- 五角大楼拟向 AI 云初创 Fluidstack 提供约 50 亿美元贷款 — vitaliychiley · 2026-09-11
- Eric Schmidt:AI 的真正瓶颈不是电力而是钱,万亿美元资本难筹 — rohanpaul_ai · 2026-09-11
- SpaceX 再签 AI 算力大单:月入 11.1 亿美元,年化 ARR 冲 1000 亿 — NinaDSchick · 2026-09-11
- Carmack:Jetson Thor 128GB 内存对实时机器人是过度配置 — ID_AA_Carmack · 2026-09-11
- YC Demo Day 钻石晶圆初创揽 1.6 亿美元意向订单,挑战硅基芯片 — ycombinator · 2026-09-11