DeepSeek V4长上下文表现受限,全压缩层设计或是短板
bookwormengr · x · 2026-07-31
作者分析指出,尽管 DeepSeek V4-Flash 经历了大幅升级,但在长上下文推理上的表现依然逊色于 MiniMax-2.7 和 Kimi K3,甚至 V4 Pro 也不及预期。
推测认为,这源于 DeepSeek V4 完全放弃了全注意力层。其架构由 2 层 SWA、21 层 CSA 以及 HCA 组成,这些沿序列维度压缩的机制本质上是有损的,虽极大降低了 KV 缓存体积,却牺牲了长文本性能。
相比之下,Kimi K3 保留了 24 层 MLA 全注意力层(占比 25%),在缓存大小与长上下文能力之间取得了更具优势的折中方案。
「模型」频道最新
- KOL 调侃模型竞争:算力与资源才是硬道理 — teortaxesTex · 2026-07-31
- 腾讯混元 Hy-MT2 下载破 70 万,30B 版本发布 GGUF 格式 — victormustar · 2026-07-31
- Gemini Flash 低价被指堪比 DeepSeek 时刻 — eyishazyer · 2026-07-31
- DeepSeek 展现自主拆解能力,无需提示即用 subagent — teortaxesTex · 2026-07-31
- 上下文超限后失忆,Claude 3.5 Sonnet 异常被吐槽 — Numerous-Recover7685 · 2026-07-31
- 同价位大模型实测:DeepSeek V4-Flash 多模态胜过 GPT-5.6 Luna — teortaxesTex · 2026-07-31