曝 DeepSeek V4.1 Flash:552B 总参数、新稀疏注意力与原生视觉
donglixp · x · 2026-09-10
- 爆料称 DeepSeek V4.1 Flash 总参数 552B,每 token 激活 8/16B,使用全新架构,训练数据 45T tokens。
- 架构亮点:编码器/解码器结构下输入与输出 token 使用不同的激活参数量、engram 机制、新的稀疏注意力、新的 mHC、原生视觉能力。
- 评测成绩据称很高(超越 K2/K3),效率出色,技术报告质量被称赞。
- 技术引用了 YOCo(You Only Cache Once)decoder-decoder 架构论文(arXiv:2405.05254),用于 KV cache 压缩:self-decoder 编码全局 KV cache,cross-decoder 通过交叉注意力复用,大幅降低显存占用并加速 prefill。
- 注意:此为第三方转述,尚无官方确认。
所属事件:传 DeepSeek V4.1/Flash 曝光:552B 非对称激活挑战 GPT-5.6 Sol(18 条相关)→
「模型」频道最新
- ChatGPT Pro 20x 停止新购,已有订阅不受影响 — jdjohnson · 2026-09-10
- GPT-4o 谱图分类已近人类专家水平,两年前就能做到 — TuhinChakr · 2026-09-10
- 曝 DeepSeek V4.1 Flash 后训练细节:数据合成驱动 RL 复兴 — joecole · 2026-09-10
- ChatGPT Pro 20x 已暂停新购,官方称老订阅不受影响 — btibor91 · 2026-09-10
- 开 GPT Astra Ultra 说声 continue,25 秒就撞用量上限 — ChrisUniverse · 2026-09-10
- Grok 4.7 或于9月11日周五发布,xAI近期更偏好周三出牌 — koltregaskes · 2026-09-10