DeepSeek-V4-Flash 架构曝光:284B 总参,FP4 混合精度,原生支持百万上下文
vllm_project · x · 2026-08-01
vLLM Recipes 页面意外泄露了 DeepSeek-V4-Flash 模型的详细技术文档。作为 V4 预览家族的新成员,该模型总参数量达 284B,激活参数仅为 13B。
核心架构亮点:
- 混合注意力机制:结合了压缩稀疏注意力 (CSA) 与重度压缩注意力 (HCA)。
- 极致显存优化:配合流形约束超连接,在 100 万上下文长度下,其每 token 推理算力仅需 V3.2 的 27%,KV Cache 占用仅为 10%。
- 混合精度存储:MoE 专家权重采用 FP4 存储,其余参数(如注意力、路由等)采用 FP8。
- 推理加速:支持多 Token 预测 (MTP) 及 DSpark 推测解码。
部署与变体:
模型基于 32T+ tokens 预训练,采用两阶段后训练流水线。官方提供了四个变体检查点,包括原生 FP4+FP8 混合权重版,以及由 NVIDIA 重新量化的 NVFP4 版本(专为 Blackwell GPU 优化)。
所属事件:DeepSeek-V4-Flash架构曝光:主打百万上下文(3 条相关)→
「Infra」频道最新
- 马斯克预测:长期 99.99% 的 AI 算力将迁移至太空 — XFreeze · 2026-08-01
- 联发科数据中心芯片业务发力:TPU v8t将贡献超20亿美元营收 — BenBajarin · 2026-08-01
- 单次任务烧掉 5000 万 token,开发者展示 Claude 3.5 Sonnet 真实账单 — msg · 2026-08-01
- 算力基建狂飙:一个机场面积能建多少数据中心? — chrisalbon · 2026-08-01
- 7张3090极限压榨:成功跑通DeepSeek-V4量化版 — _akhaliq · 2026-08-01
- a16z:AI基础设施需求未见放缓,供应链瓶颈显现 — a16z · 2026-08-01