DeepSeek V4.1 Flash 的全局注意力:三种 KV 复用变体的压缩注意力

nrehiew_ · x · 2026-09-11

nrehiew 解读 DeepSeek V4.1 Flash 的「全局注意力」:本质是升级版压缩注意力,三种变体都先在小 KV 上跑 indexer 做选择,再与窗口化 KV 拼接后进注意力。区别在于:

配套的 20 层 encoder + 20 层 decoder 设计:prefill 昂贵,下半层生成 KV cache 并投影后共享给上半层,可视为被后层各自读取的状态——灵感来自 YOCO,即所谓 decoder-decoder(SWA 层除外)。

所属事件:DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →