MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB
zephyr_z9 · x · 2026-07-28
帖子拆解了一种带 MLA 层和 KDA 状态的架构在 100 万 token 上下文下的内存开销。
给出的结论是:
- MLA 层生成的 KV cache 约为 每百万 token 12 GB
- 这大约是“whale”基线的 3 倍
- 固定的 KDA state 约为 230 MB(BF16)
后续讨论集中在 KV 估算是否正确,以及 BF16 是否真是合适的精度假设。
「Infra」频道最新
- 高通称 NPU 延迟优势让端侧 AI Agent 更实用 — qdrant_engine · 2026-07-28
- 70B 模型在 AMD R9700 上加载卡住,显存已到 30GB — Developer-Y · 2026-07-28
- Reddit 讨论本地跑 K3 的最低成本方案 — ylchao · 2026-07-28
- K3 上线一天就被拿去刷免费额度 — Mediocre-Witness-778 · 2026-07-28
- TRELLIS.2 INT8 ConvRot 已能在 AMD ROCm 上原生跑 ComfyUI — DrBearJ3w · 2026-07-28
- AI 数据中心扩张正在重塑电网与备用电力激励 — kleffew94 · 2026-07-28