推理算力稀缺怎么分?「推理拍卖」机制让用户出价表达延迟敏感度

nhaghtal · x · 2026-10-10

作者指出,LLM 推理服务中当算力稀缺时,请求优先级基本靠少数几档固定分层,粒度粗,无法表达不同请求对延迟的敏感度——实时对话、编码 agent 等待下一步响应、夜间长跑研究查询的延迟需求完全不同。作者提出用拍卖机制让用户对稀缺推理资源出价表达偏好,但推理服务不是普通商品:现代系统高度依赖 KV-cache 复用与精细调度的延迟收益,朴素地先服务最高出价者会破坏这些优化。其「Inference Auctions」方案可在不牺牲这些系统优化、不影响延迟的前提下,可证明地最大化社会福利。

所属事件:Mike Jordan 团队提出 Inference Auctions:用拍卖分配推理算力(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →