V4.1 Flash 详解:每 token 缓存缩至 890 字节,闲时命中仅 2 分

赛博禅心 · wechat · 2026-09-10

DeepSeek V4.1 Flash 开源上线,总参数 550B,输入激活 8B、输出激活 16B 的非对称 MoE 设计,主打 Agent 任务:DeepSWE v1.1 从 62.7 提到 74.2,Terminal-Bench 3.0 从 11.8 提到 30.0,部分成绩超过 Kimi K3、GLM 5.3、Opus 5 与 GPT 5.6-Sol,但 GPQA Diamond 仍低于 V4 Pro,并非全面领先。

成本方面,每 token KV Cache 从上一代 3514 字节降至 890 字节(约为 V1 的 1/437),缓存 HBM 需求降至 1/4、SSD 降至 1/8。API 峰谷定价:闲时缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰翻倍;缓存命中与未命中单价相差 50 倍。V4 Pro 等旧模型名将陆续路由到新模型计费。

配套 DeepSeek Harness v0.1.5 与模型训练深度结合:支持文件上传与预览、父子 Agent 双向通信、实验性 Agent Teams 多智能体协作;社区已用两轮提示词做出剪纸风游戏《纸虎》等案例。有约 2000 张 GPU 资源的团队可联系合作大规模部署。

所属事件:DeepSeek 发布 V4.1-Flash:新架构 MoE 开源(29 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →