Netflix公开内部LLM推理栈

AxSaucedo · x · 2026-07-20

Netflix 发布了他们如何在组织内部以大规模 LLM inference stack 支撑多种用例的介绍。配图展示了整体服务架构:消费者应用先通过统一服务做路由、预处理和后处理,推理阶段交给 NVIDIA Triton Inference Server,并与 vLLM 配合;同时还会访问多个数据源做特征/数据获取。

这张图体现的是一个典型的企业级统一 serving system:按用例和 AB 分流、前后处理与推理解耦,并把模型打分服务单独抽出来。

所属事件:Netflix公开内部LLM推理栈(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →