DeepSeek v4.1-Flash 发布:763B 新因果编码器-解码器架构带视觉回归
Latent Space · rss · 2026-09-12
Latent Space AI News 深度解读 DeepSeek v4.1-Flash:总参数 763B,创新性采用因果编码器-解码器架构,prefill/decode 分离——输入仅激活 8B、输出激活 16B(稀疏度 1-2%),搭配滑动窗口注意力有界回放(SWA Bounded Replay),KV cache 占用最高降至 V4 Flash 的 1/8,对长时运行 agent 更快更省。
要点:
- 命名争议:Sebastian Raschka 称其为“大改版,应该叫 V5”;作者认为仅看 benchmark 标题会低估其进步——号称迄今公开解释中最具创造性和效率的上下文使用方式,且首次内置视觉输入。
- 评测与价格:Artificial Analysis 智能指数 40 分,超 V4 Pro 0813、略低于 GLM-5.3-Flash;定价 $0.30/1M 输入、$1.20/1M 输出,缓存输入 $0.006/1M,另有 50% 错峰折扣;1M 上下文,MIT 许可,文本+图像输入。Vals 称其为开源权重第一,超过 Kimi K3。
- 架构细节:滑动窗口+稀疏检索混合分支,类似 HySparse/NSA/CSA 思路的延续;视觉侧用 3x3 pixel unshuffle(非常见 2x2),视觉前端与 K3 差异明显;有效 decoder 层数被大幅压缩。
- 生态:Baseten 零日支持,Ollama 已向 Max/Team/Pro 用户推送。
「模型」频道最新
- MiniCPM5-2B 上架 Hugging Face,作者称 Llama 架构可胜 Qwen3.5 — solyarisoftware · 2026-09-12
- 同一模型同一榜单分数大不同,DeepSeek 模型卡揭示评测失真 — solyarisoftware · 2026-09-12
- OpenAI 与数学家争端持续升级,TechCrunch 梳理事件全貌 — joe4942 · 2026-09-12
- 开源说话人分离模型 SUPlime 超越 pyannote 商业版,基准 DER 15.86 — solyarisoftware · 2026-09-12
- 连续三款前沿模型遭用户回退,感知质量下滑引发争论 — alexisgallagher · 2026-09-12
- DeepSeek V4.1 Flash 技术报告解读:三层压缩让 552B 打败 1.6T — 机器之心 · 2026-09-12