DeepSeek 开源 V4.1 Flash:552B 非对称 MoE 架构,砍掉 V4 Pro
机器之心 · wechat · 2026-09-10
DeepSeek V4.1 Flash 在网页、App 与 API 端全面上线并开源。模型为 552B 总参数的 MoE,采用全新 Causal-Encoder-Decoder 架构,输入侧仅激活 8B、输出侧激活 16B,配合新预训练方法与更大规模强化学习后训练,官方称核心指标全面超越 V4 Pro。
基准表现:在 DeepSWE v1.1(74.2,小幅领先 Opus5)、CyberGym、Automation-Bench 上取得图中最高分,但在 Terminal-Bench 3.0(30.0)上明显低于 Opus5(43.3)和 GPT-5.6 Sol(34.4),GPQA Diamond 等仍未全面占优,Coding/Agent 类任务竞争力强但并非全胜。
成本优化是另一主线:针对 Agent 负载「几万 token 输入换几百 token 输出」的特点做非对称设计;KV Cache 相比上一代大幅压缩,HBM 需求降至 1/4、SSD 降至 1/8,缓存小到权重读取成为瓶颈,社区测出 400 token/s 且速度不随上下文衰减。
价格与迁移:9 月 14 日后 V4 Pro API 下线,请求自动路由至 V4.1 Flash,闲时输入缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰为闲时 2 倍。C 端网页/App 的快速、专家、识图三模式已合并接入 V4.1 Flash,支持深度思考+搜索。配套 DeepSeek Harness v0.1.5 同步更新,支持图片/PDF 上传与插件 UI 扩展;腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已全量接入。
所属事件:DeepSeek开源V4.1-Flash:新架构原生视觉MIT协议(29 条相关)→
「Infra」频道最新
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- Nvidia 收购 Hugging Face 后,业界呼吁建设中立替代平台 — hargup13 · 2026-09-10
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10