曝 DeepSeek 发布 V4.1-Flash:552B 参数自称达 GPT-5.6 水平
iScienceLuvr · x · 2026-09-10
X 用户 iScienceLuvr 发帖称 DeepSeek 发布了 DeepSeek-V4.1-Flash,基准成绩号称达到「GPT-5.6 Sol」级别,但总参数仅 552B,作者本人也质疑是否「刷榜」。帖子转述了其架构要点:
- 采用 Causal Encoder-Decoder(CED)架构,解码器的全局 KV 直接从编码器最终隐状态投影而来,绕过完整解码器 KV 计算
- 每 token 预填充阶段仅激活 8B 参数、解码阶段激活 16B,对输入密集的 agent 场景成本友好
- 官方称 V4 可视为「基于 SWA 的本地处理主干 + 压缩全局上下文」,核心是更激进的 KV cache 压缩
注意:该消息目前仅为第三方转述,真实性未经 DeepSeek 官方确认,需谨慎对待。
所属事件:DeepSeek V4.1 曝 552B 非对称激活架构(15 条相关)→
「模型」频道最新
- 博主实测称小米 MiMo-X-Pro 预览版质量明显领先 DeepSeek V4.1 Flash — Scobleizer · 2026-09-10
- Reddit 用户拆包 safetensors:DeepSeek V4.1 Flash 实为 748B 参数 — DistanceSolar1449 · 2026-09-10
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- 爆料补注:V4 系列或已有 3T 参数模型, Scaling 风险是关键变量 — teortaxesTex · 2026-09-10
- 爆料推算:DeepSeek V4.1 Pro 或为 3.1T 参数 MoE,磁盘占用 2.6TB — teortaxesTex · 2026-09-10