Moondream发布Photon推理编译器,吞吐最高达2.33倍
Moondream 推出了名为 Photon 的推理编译器,主张将模型描述编译成一个优化的 megakernel,使整个推理过程直接在 GPU 上运行,从而消除 CPU 到 GPU 的额外开销并释放 CPU 资源。官方基准测试显示,该方案在 H100 上对比 vLLM 和 SGLang 实现了显著的吞吐量提升,标志着推理正进入编译器时代。
已确认
- Photon 2.0 被定位为面向 Physical AI 场景的编译器驱动推理引擎,支持将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为 megakernel。
- 核心机制是系统接收模型描述后,将整个 forward pass 压缩成一个 GPU 程序,让 GPU 直接跑完整条推理链路。
- 官方公布的基准测试涵盖了 1、2、4、8 路并发请求,在 H100 上对比 vLLM 和 SGLang,吞吐量提升范围为 1.01× 至 2.33×。
为什么重要
- Moondream 认为,这种方案意味着 AI 推理正在进入编译器时代,开发者不再需要为每个部署场景手工调优。
- 通过系统自动生成优化后的 megakernel,该技术有望大幅降低调度开销,提升硬件执行效率。
2026-08-04 ~ 2026-08-04 · 6 条相关
一手来源
- Moondream 推出推理编译器,吞吐最高达 vLLM 和 SGLang 的 2.33 倍 — suchenzang ·
- Photon 2.0 把 Moondream、Qwen 3.5 编译成 megakernel — sloppenheimer · 2026-08-04
- 【源头】Moondream 推出推理编译器,吞吐最高达 vLLM 和 SGLang 的 2.33 倍 — suchenzang · 2026-08-04
- Moondream 称其推理编译器会为整模型生成 megakernel — AccBalanced · 2026-08-04
- Photon 在 H100 上号称比 vLLM 和 SGLang 快 2.33 倍 — AccBalanced · 2026-08-04
- Moondream 认为推理进入编译器时代,靠 megakernel 提速 — AccBalanced · 2026-08-04
- Photon 2.0 面向物理 AI 推理,称吞吐最高快 2.3 倍 — MikeBirdTech · 2026-08-04