GPU 调度器按未完成任务估算排队读取工作量
Abhishekcur · x · 2026-07-28
这条线程解释了 GPU 调度器里的一个细节:在计算“读取工作量”时,系统不是看当前请求自己需要读多少,而是看这块 GPU 还欠多少读取工作——包括它已经接下但没做完的请求,再加上你这次的新请求。
也就是说,系统问的不是“你有多大”,而是“你要排的队有多长”。
作者认为,正是这个细节让调度器更像真正的负载均衡器,而不是简单查表。
所属事件:Dynamo GPU 调度器按未完成读工作量打分(2 条相关)→
「Infra」频道最新
- AMD 称 MI455X 推理吞吐量将达 MI355X 的 34 倍 — Beth_Kindig · 2026-07-28
- Google Cloud 为 Gemini API 和 Vertex AI 加入近实时异常告警 — rseroter · 2026-07-28
- Block Attention Residuals 将注意力开销降到 O(Nd) — stochasticchasm · 2026-07-28
- LlamaIndex 推出 Cloudflare Worker 脚手架部署 LlamaParse — llama_index · 2026-07-28
- OpenRouter 展示同一模型的多 provider 定价与路由 — gnukeith · 2026-07-28
- Kimi K3 通过相对队列折扣提升 GPU 负载均衡 — Abhishekcur · 2026-07-28