DeepSeek V4.1 Flash 发布:769B MoE 原生视觉,1M 上下文 vLLM 零日支持
solyarisoftware · x · 2026-09-10
DeepSeek 官方发布 V4.1-Flash,新架构家族最小的模型,首次原生支持视觉理解,主打更快推理与更高吞吐,vLLM 零日适配并在 NVIDIA/AMD GPU 上验证。技术要点:
- 架构:769B 总参数、每 token 激活 15.5B,40 层、hidden size 5120,前置 32 层 ViT;1M 上下文。
- 两级稀疏注意力:每层 128 token 滑窗 + 压缩 KV 潜变量,由 V3.2-Exp 遗传的 indexer 打分保留最优 512;仅第 2/8/14/20 四层写压缩 KV,其余层共享缓存;压缩比从 V4 的 4/128 改为 1/2。
- Engram n-gram 记忆:第 1、14 层各持约 3.84 亿行×256 维的哈希表,按 4-gram 哈希查询、经学习门控写入残差流,两表合计 196.6B 参数(约 189 GiB),占检查点约四分之一——部署需专门规划容量。
- Hyper-Connections:残差流以 4 份并行副本传递,每个子层自行推导组合系数。
- 另有 DSpark 多 token 草稿头、MXFP4 专家等,V4 用户在 vLLM 上迁移成本低。
所属事件:DeepSeek开源V4.1-Flash:新架构原生视觉MIT协议(29 条相关)→
「Infra」频道最新
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- Nvidia 收购 Hugging Face 后,业界呼吁建设中立替代平台 — hargup13 · 2026-09-10
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10