DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4,主动删掉自家旧设计
teortaxesTex · x · 2026-09-16
知乎作者 Exhalation 拆解 DeepSeek V4.1 Flash:尽管总参数与激活参数都比上一代更大,工作 KV cache 却降到 1/4,持久缓存存储降到 1/8。做法是删除旧模块、共享 KV 状态并重算局部上下文:
- 移除 MTP:外部草稿模型(如 DSpark)削弱了其投机解码价值,辅助损失也不再值得占内存
- 移除重度压缩注意力:其全局摘要角色模糊,且难以与 FP4 存储结合
- 移除 Dense warmup,转向更稀疏的训练路径
teortaxesTex 评论称,这显示 DeepSeek 把二次复杂度成分推向更『稀薄』的操作层面,是在自己的科学研究中也接受 bitter lesson、寻找不可再约简的部分。这不是简单的降本,而是一次架构重置。
所属事件:DeepSeek V4.1 Flash 架构重置,KV缓存缩至四分之一(2 条相关)→
「Infra」频道最新
- 华为发布全球首个 3D 数据中心:四层垂直堆叠,交付周期砍半 — teortaxesTex · 2026-09-16
- 苏格兰新规:超 50MW 数据中心须强制提交环评 — nordicinst · 2026-09-16
- 微软押注本地 AI:从 800 美元 Copilot+ PC 到万亿参数桌面超算 — ryanshrout · 2026-09-16
- PlanetScale Traffic Control 新玩法:按应用名分配数据库资源 — DanielLockyer · 2026-09-16
- 欧洲 AI 创业者算力紧缺,VC 送 GPU 将成标配增值服务 — nellimorgulchik · 2026-09-16
- 128GB 小机跑 124B 模型:社区实测量化、MTP 与内核调优全记录 — alifcoder · 2026-09-16