PyTorch CTO:vLLM 和 SGLang 让有效 AI 工作更便宜
PyTorch · x · 2026-07-23
PyTorch Foundation CTO Matt White 在 AMD 的 Advancing AI 活动上要讲的核心问题是:如何让每一块 AI 预算产生更多有效工作,而不只是更多 token。
这场分享聚焦开源推理经济学,以及围绕 vLLM 和 SGLang 的推理栈。方法论包括:把工作流拆解成多个步骤、用合适大小的模型、智能路由和缓存、只在必要时升级到更强模型,并把衡量标准从 token 数量改成“每次成功完成任务的成本”。
所属事件:PyTorch CTO 将探讨开源 AI 推理经济优化(2 条相关)→
「Infra」频道最新
- 英伟达已成主流 Robotaxi 栈核心:训练仿真车载计算全覆盖 — pdamodaran · 2026-09-11
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11