长上下文本地推理的真正瓶颈是 KV cache 而非参数量

jonejy · reddit · 2026-09-03

作者指出,本地部署大模型的讨论过度聚焦参数量,但长上下文推理时 KV cache 才是内存瓶颈:每新增一个 token 都要保留 key/value 状态,模型本身装得进显存,到 100k–200k 上下文时也会撑爆。GQA/MQA 通过减少 KV 头、KV cache 量化进一步压缩,但缓存仍随上下文线性增长。作者判断未来本地模型优化的重心将从减参数转向减少内存搬运与持久状态,并抛出问题:模型是否会围绕「需要记住多少」而非「多少参数」来设计。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →