Kimi K3 通过相对队列折扣提升 GPU 负载均衡
Abhishekcur · x · 2026-07-28
Abhishekcur 讨论了 Kimi K3 服务调度里的一个细节:内存/缓存的“折扣”不是从零开始算,而是相对当前最空闲的 GPU来计算;同时,排队长度也是按请求自身大小来衡量,而不是固定阈值。
这意味着系统把“忙不忙”同时定义为:
- 相对于当前整组 GPU 的最空闲状态
- 相对于你这次请求的大小
帖子的核心判断是,这个设计让调度器更像真正的负载均衡器,而不只是静态查表。
「Infra」频道最新
- vLLM 携手 DigitalOcean 上线 Kimi K3 模型 — vllm_project · 2026-07-28
- AMD 称 MI455X 推理吞吐量将达 MI355X 的 34 倍 — Beth_Kindig · 2026-07-28
- Google Cloud 为 Gemini API 和 Vertex AI 加入近实时异常告警 — rseroter · 2026-07-28
- Block Attention Residuals 将注意力开销降到 O(Nd) — stochasticchasm · 2026-07-28
- LlamaIndex 推出 Cloudflare Worker 脚手架部署 LlamaParse — llama_index · 2026-07-28
- OpenRouter 展示同一模型的多 provider 定价与路由 — gnukeith · 2026-07-28