推理算力稀缺怎么分?「推理拍卖」机制让用户出价表达延迟敏感度
nhaghtal · x · 2026-10-10
作者指出,LLM 推理服务中当算力稀缺时,请求优先级基本靠少数几档固定分层,粒度粗,无法表达不同请求对延迟的敏感度——实时对话、编码 agent 等待下一步响应、夜间长跑研究查询的延迟需求完全不同。作者提出用拍卖机制让用户对稀缺推理资源出价表达偏好,但推理服务不是普通商品:现代系统高度依赖 KV-cache 复用与精细调度的延迟收益,朴素地先服务最高出价者会破坏这些优化。其「Inference Auctions」方案可在不牺牲这些系统优化、不影响延迟的前提下,可证明地最大化社会福利。
所属事件:Mike Jordan 团队提出 Inference Auctions:用拍卖分配推理算力(6 条相关)→
「Infra」频道最新
- 27B 4bit 模型 llama.cpp 仅 8-10 t/s,bitsandbytes 反而跑出 27 t/s — cephaloform · 2026-10-10
- 两大 H100 租赁价格指数周相关性仅 0.17,算力期货对冲存疑 — BenBajarin · 2026-10-10
- Chrome 新回声消除器让语音 Agent 词错率减半,不再自问自答 — chadwallacehart · 2026-10-10
- 降价刺激用量:AI 降价会否反而推高算力需求引争论 — dnlkwk · 2026-10-10
- Mike Jordan 团队新论文:用拍卖机制分配 LLM 推理算力 — nhaghtal · 2026-10-10
- SGLang-Diffusion 扩散模型推理框架将亮相 PyTorch 大会 — PyTorch · 2026-10-10