DeepSeek V4长上下文表现受限,全压缩层设计或是短板

bookwormengr · x · 2026-07-31

作者分析指出,尽管 DeepSeek V4-Flash 经历了大幅升级,但在长上下文推理上的表现依然逊色于 MiniMax-2.7 和 Kimi K3,甚至 V4 Pro 也不及预期。

推测认为,这源于 DeepSeek V4 完全放弃了全注意力层。其架构由 2 层 SWA、21 层 CSA 以及 HCA 组成,这些沿序列维度压缩的机制本质上是有损的,虽极大降低了 KV 缓存体积,却牺牲了长文本性能。

相比之下,Kimi K3 保留了 24 层 MLA 全注意力层(占比 25%),在缓存大小与长上下文能力之间取得了更具优势的折中方案。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →