DeepSeek V4.1 Flash 发布:552B 参数跑出 420-507 tok/s,Agent 成绩反超 Claude
APPSO · wechat · 2026-09-12
DeepSeek 发布 V4.1 Flash 并同步更新网页版和 App,将快速、专家、识图三合一。主干参数从 284B 翻倍至 552B,但速度反而更快:实测 420-507 tok/s,另有用户测得约 217 tok/s。
省钱架构:每 token 全局 KV cache 仅 890 字节,是 V4-Flash 的 1/4、初代 V1 的约 1/437。关键改动包括:CED 架构把 40 层分成前 20 层因果编码器 + 后 20 层解码器,长输入预处理计算量近乎减半;CSA2 让多层共享全局 KV 缓存并用 FP4(OCP 开放标准)量化;SWA Bounded Replay 把局部状态放短时内存池,用重算最近 128 token 换掉长期存储,持久 KV 缓存降到上一代约 1/8,状态可驻留 72 小时以上;外挂 196B「条件记忆」模块 Engram,用哈希表查常用词组降低成本。
训练与评测:45 万亿 token 多模态预训练,从预训练起就接触图像,Agent 可读截图自查。后训练无新算法,投入集中在任务生产:把 Agent 任务拆为问题、执行环境、验证系统,用 AI 出题、试做、查漏。DeepSWE v1.1 达 74.2%(上代 54.4%,Opus-5 为 74.0%),Terminal-Bench 2.1 达 90.6,AutomationBench 54.8 反超 Opus-5 和 GPT-5.6 Sol;但 Terminal-Bench 4.0(31.2 vs 51.8)和 GPQA Diamond(90.9 vs 92.4)与最强模型仍有差距。API 提供 low/high/max 三档推理强度。报告还指出系统提示、工具配置等 Agent 框架差异会显著改变同一模型的成绩(74.2 → 65.6)。
所属事件:DeepSeek 发布 V4.1-Flash:原生视觉、百万上下文(5 条相关)→
「编程与Agent」频道最新
- Devin Fusion 发布:混合前沿模型+低成本副模型,评分 62 首进编码 Agent 榜单 — AccBalanced · 2026-09-12
- 开源生成式 UI 框架 OpenUI:自研标记语言比 JSON 省 67% token — tom_doerr · 2026-09-12
- Codex 应用 26.908 发布:Windows 端 Pets 悬浮控制与新快捷键 — TheMoonMidas · 2026-09-12
- 把果蝇连接体接进 Hermes 智能体,简化 fly 脑负责决策 — Teknium · 2026-09-12
- opencode 修复 MCP 子进程泄漏:轮询客户端可致内存耗尽 — sugarless-sweet · 2026-09-12
- 一句话让 AI 把浏览器 3D 演示移植进 UE5,全程未用 Blender — TheMoonMidas · 2026-09-12