Kimi K3 通过相对队列折扣提升 GPU 负载均衡
Abhishekcur · x · 2026-07-28
Abhishekcur 讨论了 Kimi K3 服务调度里的一个细节:内存/缓存的“折扣”不是从零开始算,而是相对当前最空闲的 GPU来计算;同时,排队长度也是按请求自身大小来衡量,而不是固定阈值。
这意味着系统把“忙不忙”同时定义为:
- 相对于当前整组 GPU 的最空闲状态
- 相对于你这次请求的大小
帖子的核心判断是,这个设计让调度器更像真正的负载均衡器,而不只是静态查表。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- Cloudflare CTO 入选 TIME 年度高管:为 agent 时代重建互联网 — dinasaur_404 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23