推理拍卖论文:粗粒度优先级分层难以表达延迟敏感度

nhaghtal · x · 2026-10-10

该线程 2/n 指出,现有 LLM 推理服务在算力稀缺时主要靠少数几个优先级层级决定谁先被服务,过于粗糙——编码 agent、实时对话、隔夜科研查询的延迟需求各不相同,用户无法表达请求的延迟敏感度。这正是推理拍卖要解决的问题。

所属事件:Mike Jordan 团队提出 Inference Auctions:用拍卖分配推理算力(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →