SemiAnalysis 详解 NVIDIA LPU 三种分离式推理组合
SemiAnalysis_ · x · 2026-09-01
SemiAnalysis 梳理了 NVIDIA LPU 支持的三种分离式(prefill/decode 拆分)推理配置:
- Rubin Prefill + LPU Decode:交互延迟最低的最快组合;
- Rubin Prefill + Rubin Decode Attention + LPU Decode FFN:覆盖延迟曲线中段;
- Rubin Prefill + Rubin Decode Verification + LPU Drafter:用于投机解码场景,对应曲线中偏左区间。
在低交互要求场景下,纯 Rubin 仍然胜出。他们期待在 AgentX 等开源 agentic 基准上看到 Rubin + LPU 的完整性能曲线。
所属事件:NVIDIA LPU 支持三种分离式推理配置(2 条相关)→
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01