MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB
zephyr_z9 · x · 2026-07-28
帖子拆解了一种带 MLA 层和 KDA 状态的架构在 100 万 token 上下文下的内存开销。
给出的结论是:
- MLA 层生成的 KV cache 约为 每百万 token 12 GB
- 这大约是“whale”基线的 3 倍
- 固定的 KDA state 约为 230 MB(BF16)
后续讨论集中在 KV 估算是否正确,以及 BF16 是否真是合适的精度假设。
「Infra」频道最新
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23
- 从燃气到吉瓦:Diligence Stack 专家访谈拆解 AI 数据中心供电难题 — BenBajarin · 2026-09-23