MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB

zephyr_z9 · x · 2026-07-28

帖子拆解了一种带 MLA 层和 KDA 状态的架构在 100 万 token 上下文下的内存开销。

给出的结论是:

后续讨论集中在 KV 估算是否正确,以及 BF16 是否真是合适的精度假设。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →