Photon 在 H100 上号称比 vLLM 和 SGLang 快 2.33 倍
AccBalanced · x · 2026-08-04
- Moondream 声称其 Photon 在基准测试里,相比 vLLM 和 SGLang,吞吐提升达到 1.01×–2.33×。
- 图表对比了 1、2、4、8 路并发下的请求吞吐,覆盖 Moondream 3、Qwen3.5 和 Gemma 4 等模型。
- 他们还强调了另一个优势:模型启动更快,这对机器人或其他需要在崩溃/重启后迅速恢复的系统很重要。
- 测试栈标注为 Photon 2.0.0、vLLM 0.25.1、SGLang 0.5.3,硬件是 NVIDIA H100 80GB HBM3。
所属事件:Moondream发布Photon推理编译器,吞吐最高达2.33倍(6 条相关)→
「Infra」频道最新
- 云厂商与 AI 供应商正在制造昂贵的锁定风险 — DavidLinthicum · 2026-08-04
- Swarms Cloud 更新:保存工作流、会话持久化与 1500+ 模型 — KyeGomezB · 2026-08-04
- SK 海力士将在印第安纳州动工 38.7 亿美元 HBM 封装厂 — rwang07 · 2026-08-04
- Kimi K3 据称可在 8GB CPU 上靠 SSD 流式推理 — porAssass · 2026-08-04
- Subnet 44 围绕 7B 视觉语言模型 Satori 扩张训练激励 — richdotca · 2026-08-04
- AMD 财报前瞻:服务器 CPU 增长和 MI450 节奏才是关键 — tengyanAI · 2026-08-04