V4.1 Flash 详解:每 token 缓存缩至 890 字节,闲时命中仅 2 分
赛博禅心 · wechat · 2026-09-10
DeepSeek V4.1 Flash 开源上线,总参数 550B,输入激活 8B、输出激活 16B 的非对称 MoE 设计,主打 Agent 任务:DeepSWE v1.1 从 62.7 提到 74.2,Terminal-Bench 3.0 从 11.8 提到 30.0,部分成绩超过 Kimi K3、GLM 5.3、Opus 5 与 GPT 5.6-Sol,但 GPQA Diamond 仍低于 V4 Pro,并非全面领先。
成本方面,每 token KV Cache 从上一代 3514 字节降至 890 字节(约为 V1 的 1/437),缓存 HBM 需求降至 1/4、SSD 降至 1/8。API 峰谷定价:闲时缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰翻倍;缓存命中与未命中单价相差 50 倍。V4 Pro 等旧模型名将陆续路由到新模型计费。
配套 DeepSeek Harness v0.1.5 与模型训练深度结合:支持文件上传与预览、父子 Agent 双向通信、实验性 Agent Teams 多智能体协作;社区已用两轮提示词做出剪纸风游戏《纸虎》等案例。有约 2000 张 GPU 资源的团队可联系合作大规模部署。
所属事件:DeepSeek 发布 V4.1-Flash:新架构 MoE 开源(29 条相关)→
「Infra」频道最新
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- Nvidia 收购 Hugging Face 后,业界呼吁建设中立替代平台 — hargup13 · 2026-09-10
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10