SGLang 首日支持 DeepSeek-V4.1 Flash,详解新架构设计
ying11231 · x · 2026-09-10
LMSYS 团队宣布 SGLang 与 RL 框架 Miles 在发布首日即支持 DeepSeek-V4.1 Flash,并发布技术博客拆解新架构。
关键架构要点:
- 压缩 KV 跨层共享:每层维护最近 128 个位置的 fp8 滑动窗口缓存,选定源层生成 fp4 压缩表示供长程注意力使用;查询同时关注本地窗口和由 indexer 选出的最多 512 个压缩位置,压缩与检索选择在层间共享。
- 两级稀疏 indexer 与 mHC(流形超连接):每个子层通过 token 相关混合系数读写四条并行残差流,系数投影可与当前注意力/FFN 计算重叠。
- Engram 查找内存:第 1、14 层用哈希 n-gram 键从 fp8 大表中检索行并门控进残差流,博客详述了主机内存放置与性能优化。
- Miles 支持 RL:已验证 RL 训练可跑通。
模型参数:552B backbone(16B 激活解码/8B prefill),原生多模态,最长 1M 上下文。团队称未来几天将有重大性能优化。
所属事件:DeepSeek 发布 V4.1 Flash:新架构原生视觉、MIT 开源(35 条相关)→
「Infra」频道最新
- 一天烧 40 亿 token,14 次按键把账单砍 500 倍,作者担忧 5 万亿美元债务 — gaganghotra_ · 2026-09-10
- DeepSeek 稀疏化新动向:token 效率看齐 OpenAI,告别「胖鲸吃白饭」 — teortaxesTex · 2026-09-10
- Acellera 实测:单张 RTX 5090 跑本地模型做药物发现 — gdefabritiis · 2026-09-10
- Mac mini 实测:35B 本地运行时达 Haiku 水准,但不适合 Agent — PawelHuryn · 2026-09-10
- Miles 为 DeepSeek-V4.1-Flash 提供 Day-0 RL 支持,KL 仅 0.0012–0.0017 — ying11231 · 2026-09-10
- 数据中心是一个符号:拆解反数据中心叙事背后的情绪 — ShakeelHashim · 2026-09-10