实测 KV 缓存混合技术,预填提速 3 倍
maddie-lovelace · reddit · 2026-08-22
作者分享了在 LLM 推理中尝试 KV cache blending 的实测结果。该技术将长 prompt 切分片段独立生成缓存再拼接,原本预期会失败,但在 Ling3-tiny 模型(非 KDA 层)上测试发现,只要片段间保留重叠,模型仍能保持完美的“大海捞针”检索能力,甚至支持跨片段综合。实测显示该方法在 256k 上下文下将预填速度提升 3 倍,达到约 1.3k tps,性能接近 Qwen 38-27B 在 5090 上的表现。
「Infra」频道最新
- H100 缺货需等一年,算力瓶颈实为电力冷却与人才 — ingliguori · 2026-08-22
- Parsewave 案例预示 AI 训练转向高质量数据合成 — trashnash007 · 2026-08-22
- GLM 5.2 跑出 35t/s 生成速度,DwarfStar 实现 Agent 级推理 — antirez · 2026-08-22
- 美数据中心建设受阻致算力外迁,电力瓶颈成关键 — Dan_Jeffries1 · 2026-08-22
- GLM-5.3 推理提速 21 倍,Kimi 线性解码优化内核实测 — teortaxesTex · 2026-08-22
- 博主实测:为何去印度搭双 3090 跑 Qwen 本地模型 — Ubunta · 2026-08-22