DeepSeek V4.1 Flash 的全局注意力:三种 KV 复用变体的压缩注意力
nrehiew_ · x · 2026-09-11
nrehiew 解读 DeepSeek V4.1 Flash 的「全局注意力」:本质是升级版压缩注意力,三种变体都先在小 KV 上跑 indexer 做选择,再与窗口化 KV 拼接后进注意力。区别在于:
- 不复用
- 复用早层 KV 与 indexer K
- 复用 indexer 的选择结果
配套的 20 层 encoder + 20 层 decoder 设计:prefill 昂贵,下半层生成 KV cache 并投影后共享给上半层,可视为被后层各自读取的状态——灵感来自 YOCO,即所谓 decoder-decoder(SWA 层除外)。
所属事件:DeepSeek V4.1 Flash 技术深读:KV cache 压缩造就高效旗舰(7 条相关)→
「模型」频道最新
- 类比喻引热议:把模型「最努力」推到极致的代价 — voooooogel · 2026-09-11
- 圈内人讨论:强化「最大努力」行为会连带放大模型副作用 — voooooogel · 2026-09-11
- Claude 成蒸馏首选真因:agent 时代种子数据难寻 — teortaxesTex · 2026-09-11
- 圈内讨论:中国实验室为何总从 Anthropic 蒸馏而非 OpenAI — teortaxesTex · 2026-09-11
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11