max-context KV 预留到底浪费什么?Reddit 推理工程讨论
werunm · reddit · 2026-09-18
Reddit 上一个推理工程的推演帖:当请求按 max context 预留 KV cache 空间时,那段「死区」除了限制并发外还有什么成本?
- 作者第一直觉是会拖慢 decode,但随后否定了:没有任何计算去读死区,只是内存不可用。
- 真实成本是并发上限由「预留量」而非「实际 token 数」决定,会在远低于物理容量处撞墙——这正是 paged KV 的动机。
- 遗留问题:如果负载均匀、请求真的都跑在接近 max context,paging 除了簿记开销还买到什么?
「Infra」频道最新
- Ben Bajarin:算力走向同质化,超大规模云厂商重构数据中心经济学 — BenBajarin · 2026-09-18
- Android 端 LLM Studio:离线跑模型、本地生图还能当 AI 服务器 — Miserable_Bird5822 · 2026-09-18
- fal 把开源视频模型提速 35 倍,好莱坞成增长最快客户 — a16z · 2026-09-18
- AMD 拟对 GPU、芯片组乃至 CPU 全面提价约 10% — FullstackSensei · 2026-09-18
- 开发者在单张 5090 上打造本地版"ChatGPT 百宝箱",细节全是坑 — valdev · 2026-09-18
- 英国国王会晤 OpenAI 等高管,AI 安全升至元首级议题 — eyishazyer · 2026-09-18