Kimi K3 常量状态设计让长上下文显存降约 73%
bookwormengr · x · 2026-07-29
这条帖在分析 Kimi K3 的“常量状态”设计,以及它对长上下文推理显存成本的影响。
- 配图给出的对比显示:在 128K tokens 下,All-MLA (93L) 需要 13.7 GB,而 Kimi K3 (24 MLA + KDA state) 只要 3.5 GB + 0.22 GB;到 1M tokens 时分别是 107 GB 对 29.0 GB + 0.22 GB。
- 帖子核心观点是:Kimi K3 通过 Kimi Delta Attention (KDA) / shared-key-value 这类设计,避免了 KV cache 随上下文长度线性膨胀,从而显著降低显存占用。
- 作者进一步把这件事上升到长期经济影响:如果长上下文推理所需的内存比预期少得多,那么围绕显存和内存芯片的价格上涨逻辑,可能需要重新评估。
所属事件:Kimi K3 长上下文优化:显存大降且推理提速(2 条相关)→
「Infra」频道最新
- Antirez 说大模型拆分是反模式,Hugging Face 应该替用户隐藏 — antirez · 2026-07-29
- 帖子称 GPU 下月涨 15%,本地 AI 也将受限 — AIFlow_ML · 2026-07-29
- SK hynix 二季度营收不及预期、净利大超预估 — basedjensen · 2026-07-29
- vLLM 维护者在 AMD Advancing AI 获 AI Core Contributor 奖 — vllm_project · 2026-07-29
- AI 与半导体股票正显现见顶分发迹象 — Dan_Jeffries1 · 2026-07-29
- AI 资本仍在涌入,开源权重和推理更像小步机会 — vaibhavbetter · 2026-07-29