Nebius 工程师拆解开源 LLM 生产级推理加速全链路
AI Engineer · youtube · 2026-10-04
AI Engineer World's Fair 2026 上,Nebius 的产品负责人 Dylan Bristot 与开发者布道师 Sujee Maniyam 系统讲解了如何在生产环境中高效低成本地服务开源模型。
要点:
- 开源 vs 闭源 API:开源模型能力已接近闭源,自托管可规避成本与锁定问题;演讲还梳理了「推理→数据→后训练→部署」的完整闭环。
- 硬件层:最新 NVIDIA 硬件上的 NVFP4 量化。
- 服务引擎选型与 cache-aware routing:相比朴素负载均衡,缓存感知路由能显著提升 KV cache 命中率。
- 投机解码:可用自有流量训练定制 draft 模型提升解码速度。
- KV cache offloading 与 prefill/decode 分离部署。
- 量化甜蜜点:在精度与吞吐间寻找最佳平衡。
视频提供逐层(硬件→引擎→路由→解码→缓存)的推理优化路线图,并附 Nebius Token Factory 文档链接,适合自托管开源 LLM 的工程团队参考。
「Infra」频道最新
- Qwen 3.8 Flash Next 本地实测:80-110 tok/s 替代 27b 的新选择 — inthesearchof · 2026-10-04
- Simon Willison:AI agent 时代,所有按量付费服务都该默认设硬性消费上限 — Simon Willison · 2026-10-04
- Ben Bajarin:算力未来是可互换的,芯片价格不决定云厂商成本 — BenBajarin · 2026-10-04
- 开源 local-codex-proxy:在 Codex/ChatGPT 里跑本地模型 — TheZachMueller · 2026-10-04
- 数据中心租约险或成新蓝海,投资人公开征集「给 AI 的保险」创业者 — katieruthmishra · 2026-10-04
- 数据塔余热可供暖10万户:85°C热源年供1TWh,约占巴黎5%家庭 — IgorCarron · 2026-10-04