DeepSeek V4.1 缓存压缩至 1/437,Flash 以 39 分反超 V4-Pro
DeepLearningAI · x · 2026-10-08
DeepLearning.AI 本周 The Batch 深度拆解了 DeepSeek-V4.1 架构如何削减缓存读取成本。核心洞察:agent 场景下模型"读远多于写",每次工具调用都要把相同上下文重送一遍,存取上下文的成本已超过推理计算本身,成为服务成本瓶颈。
关键数据:
- 每 token 缓存仅 890 字节,比 DeepSeek-V1 小 437 倍
- 输入从 4K 扩展到 1M token,每输出 token 计算仅增加 25%
- Flash 在 Artificial Analysis 指数上以 39 分反超 V4-Pro 的 36 分,单任务成本 $0.27 vs $0.67
架构要点:编码器-解码器 MoE 架构,552B 主干参数 + 196B 记忆模块,读取时每 token 仅激活 8B、生成时激活 16B;首次在 V4 系列正式支持图像输入;输出最高 384K token,速度 225.6 tokens/秒,仅次于 Gemini 3.8 Flash;发布时为 Vals Index 上最强开源权重模型;API 价格同步下调,峰值时段 $0.30/$0.006/$1.20(百万输入/缓存/输出 token),非峰值再减半。
「Infra」频道最新
- 三星单季营业利润 107.4 万亿韩元,创全球科技公司史上最高 — firstadopter · 2026-10-08
- FT 三部曲:中国数据中心热潮消化内蒙古全球最大电力过剩 — EleanorOlcott · 2026-10-08
- 乌兰察布聚集 89 个数据中心,靠廉价绿电与邻近北京吸睛 — EleanorOlcott · 2026-10-08
- 内蒙古废弃中学改建 AI 数据中心,折射中国经济转型 — EleanorOlcott · 2026-10-08
- SpaceX 拟融资 400 亿美元购英伟达芯片,Apollo 牵头放贷 — nordicinst · 2026-10-08
- OpenRouter 流量榜:Together 日均 2.4T tokens 居首超 OpenAI — togethercompute · 2026-10-08