Photon 2.0 面向物理 AI 推理,称吞吐最高快 2.3 倍
MikeBirdTech · x · 2026-08-04
Photon 2.0 面向 Physical AI 推理场景
Moondream 发布 Photon 2.0,把它定位为面向 Physical AI 的推理引擎,当前支持 Moondream、Qwen 和 Gemma,后续还会加入更多模型。
核心主张
- Photon 2.0 主要服务于 机器人、摄像头、工业系统、computer-use agent 等场景。
- 团队认为这类工作负载与聊天模型不同:并发更低、延迟要求更严、且经常处理实时感知数据。
- 在 NVIDIA H100 的对比测试中,Photon 2.0 号称在吞吐测试上全面超过 vLLM 和 SGLang。
- 公司称吞吐最高可提升到 2.3 倍,并且模型上线更快。
为什么需要新的引擎
- 现有推理栈主要围绕批处理 prompt、最大化 GPU 集群 tokens/s 来优化。
- Physical AI 则会持续摄入 图像、音频和视频,很多时候要拿吞吐换响应时间。
- Moondream 认为,模型 × 芯片 × 部署目标的组合太多,靠手工调优内核难以规模化。
更大的意义
Photon 2.0 被包装为一套面向感知型 AI 的基础设施,适用于边缘、私有部署和云端的多种环境。
所属事件:Moondream发布Photon推理编译器,吞吐最高达2.33倍(6 条相关)→
「Infra」频道最新
- 云厂商与 AI 供应商正在制造昂贵的锁定风险 — DavidLinthicum · 2026-08-04
- Swarms Cloud 更新:保存工作流、会话持久化与 1500+ 模型 — KyeGomezB · 2026-08-04
- SK 海力士将在印第安纳州动工 38.7 亿美元 HBM 封装厂 — rwang07 · 2026-08-04
- Kimi K3 据称可在 8GB CPU 上靠 SSD 流式推理 — porAssass · 2026-08-04
- Subnet 44 围绕 7B 视觉语言模型 Satori 扩张训练激励 — richdotca · 2026-08-04
- AMD 财报前瞻:服务器 CPU 增长和 MI450 节奏才是关键 — tengyanAI · 2026-08-04