DeepSeek V4.1 Flash 发布:890B KV 缓存压缩,agentic 成绩超 V4 Pro
togethercompute · x · 2026-09-13
Together AI 上线 DeepSeek V4.1 Flash,官方页面披露完整细节:
- 架构:多模态 MoE,Causal Encoder-Decoder(20 层编码 + 20 层解码),552B 主干 + 196B Engram 查找记忆;prefill 仅激活 8B、decode 激活 16B,大幅削减输入密集型 agent 工作负载成本。
- KV 缓存:Compressed Sparse Attention 2 + FP4 KV caching,把全局缓存压到 每 token 890 字节,约为 DeepSeek V4 Flash 的四分之一,支撑 1M token 上下文。
- 能力:原生图文多模态,从零训练于 45T 多模态 token;推理强度可按请求在 1–100 连续调节;在 DeepSeek 公布的 agentic 套件上全面领先,超过体量大得多的 V4 Pro,官方称其 agentic 基准成绩超过 GPT-5.6 Sol 且每任务成本仅三分之一。
- 可用性:MIT 许可证开源,Together AI 提供 serverless 与专用部署,99.9% SLA。
所属事件:DeepSeek V4.1 Flash 上线 Together AI,性能超 GPT-5.6 Sol 成本仅三分之一(3 条相关)→
「编程与Agent」频道最新
- 实测 OpenAI GPT-Live-1 语音代理:音质最自然但听不懂 yes — kolchinski · 2026-09-13
- 开源项目 no-ai-slop:一键清除 20+ 种 AI 味表达,8.7k 星 — tom_doerr · 2026-09-13
- Devin SWE-2 首日实测:速度快、价格友好,续航不及 Codex — CtrlAltDwayne · 2026-09-13
- Roboflow 上线 GPT-6 Astra 自动标注并设为默认模型 — Roger_M_Taylor · 2026-09-13
- 实测对比:Gemini 集成测试挂,Grok/Kimi 易漏需求 — zainhas · 2026-09-13
- 数十亿美元公司全面转向 AI 编码半年后承认毫无生产力提升 — jmclondon97 · 2026-09-13