Netflix公开内部LLM推理栈
AxSaucedo · x · 2026-07-20
Netflix 发布了他们如何在组织内部以大规模 LLM inference stack 支撑多种用例的介绍。配图展示了整体服务架构:消费者应用先通过统一服务做路由、预处理和后处理,推理阶段交给 NVIDIA Triton Inference Server,并与 vLLM 配合;同时还会访问多个数据源做特征/数据获取。
这张图体现的是一个典型的企业级统一 serving system:按用例和 AB 分流、前后处理与推理解耦,并把模型打分服务单独抽出来。
所属事件:Netflix公开内部LLM推理栈(2 条相关)→
「Infra」频道最新
- 新论文提出 PoLar:动态跳过或循环 LLM 层级以优化推理 — ttkciar · 2026-07-22
- SK海力士CEO:明年将是行业史上供应最紧张的一年 — Beth_Kindig · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- 分析称五大科技巨头隐匿 1.6 万亿美元 AI 债务 — arto · 2026-07-22
- DeepSeek-V4-Flash 单卡 B300 批量仅 770 tok/s — Moreh · 2026-07-22
- NVIDIA 开始交付 102.4 Tbps 的 Spectrum-6 交换机 — nvidia · 2026-07-22