Baseten 推理课拆解快速可靠 AI 服务的新栈

Latent Space · rss · 2026-08-04

这期 Latent Space 访谈把“推理工程”讲成了一门独立学科。Baseten 的 Philip Kiely 和 Ali Taha 重点讨论了 cache-aware routing、prefill/decode 分离、量化、speculative decoding、KV cache 迁移、模型并行、GPU kernel 优化,以及独立部署和共享 API 之间的成本与可靠性取舍。

话题还延伸到 NVIDIA Dynamo、本地推理、AI 专用芯片,以及长视频生成背后的算力瓶颈。核心观点是:推理优化仍然能带来非常可观的收益,量化不仅可能保住 benchmark 表现,还能显著提升吞吐;而把开源模型做成可生产部署的 API,本身已经是一整套系统工程。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →