DeepSeek V4.1 缓存压缩至 1/437,Flash 以 39 分反超 V4-Pro

DeepLearningAI · x · 2026-10-08

DeepLearning.AI 本周 The Batch 深度拆解了 DeepSeek-V4.1 架构如何削减缓存读取成本。核心洞察:agent 场景下模型"读远多于写",每次工具调用都要把相同上下文重送一遍,存取上下文的成本已超过推理计算本身,成为服务成本瓶颈。

关键数据:

架构要点:编码器-解码器 MoE 架构,552B 主干参数 + 196B 记忆模块,读取时每 token 仅激活 8B、生成时激活 16B;首次在 V4 系列正式支持图像输入;输出最高 384K token,速度 225.6 tokens/秒,仅次于 Gemini 3.8 Flash;发布时为 Vals Index 上最强开源权重模型;API 价格同步下调,峰值时段 $0.30/$0.006/$1.20(百万输入/缓存/输出 token),非峰值再减半。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →