长上下文本地推理的真正瓶颈是 KV cache 而非参数量
jonejy · reddit · 2026-09-03
作者指出,本地部署大模型的讨论过度聚焦参数量,但长上下文推理时 KV cache 才是内存瓶颈:每新增一个 token 都要保留 key/value 状态,模型本身装得进显存,到 100k–200k 上下文时也会撑爆。GQA/MQA 通过减少 KV 头、KV cache 量化进一步压缩,但缓存仍随上下文线性增长。作者判断未来本地模型优化的重心将从减参数转向减少内存搬运与持久状态,并抛出问题:模型是否会围绕「需要记住多少」而非「多少参数」来设计。
「Infra」频道最新
- 一次 int8 运算让 late-interaction 检索的精确重打分几乎零成本 — antoine_chaffin · 2026-09-03
- AMD 显卡跑 ComfyUI:RX 6800 XT 与 9060 XT 差价 105 美元怎么选 — Nice-Regret-9207 · 2026-09-03
- 开发者提醒:Cloudflare 新增功能疑似损害 SEO,建议关闭 — gaganghotra_ · 2026-09-03
- Hot Chips 名单未见 Amazon Trainium,投资人质疑其真实竞争力 — firstadopter · 2026-09-03
- Dragonfly 重写 Redis:分片多线程架构吃满现代服务器算力 — techNmak · 2026-09-03
- 蔡司高管:中国光刻工具落后约十五年 — broodsugar · 2026-09-03