Perplexity 开源 Lily:Apple 芯片上的 Qwen 专用推理引擎
Perplexity 于 9 月 3 日在推文串中宣布开源本地推理引擎 Lily,这是为其 Perplexity Computer 的 hybrid compute 混合计算架构打造的本地推理引擎,代码(pplx-garden/lily,Rust 实现)已上线 GitHub。Lily 专为 Apple Silicon 上的 Qwen3.6-35B-A3B(MLX affine 4-bit 权重)定制,转发帖提及解码速度提升 35%。
已确认
- Lily 由 Perplexity 官方开源,定位为 Perplexity Computer 混合计算架构中的本地推理引擎,GitHub 仓库为 pplx-garden/lily,采用 Rust 实现。
- 优化目标为 Apple 芯片上的 Qwen3.6-35B-A3B,使用 MLX affine 4-bit 权重。
- 设计理念是把 Apple 芯片当作独立推理平台,将 Qwen 的算子直接映射到其计算与内存架构上。
- 转发帖 (@inductionheads) 转述解码速度提升 35%,并称可避免端侧计算瓶颈。
为什么重要
- Perplexity 在推文串中解释:hybrid compute 将任务拆分给云端模型与 Mac 上的本地模型,本地推理必须跟上整体任务节奏、不能拖慢整体任务,因此需要专用引擎。
- Perplexity 对比了与通用框架的差异:MLX-LM 是通用框架,而 Lily 是为这一特定推理负载量身定制的,体现了「专用引擎 vs 通用框架」的工程取舍,对端侧大模型部署具有参考价值。
2026-09-03 ~ 2026-09-03 · 5 条相关
一手来源
- Lily 开源上线:把 Qwen 算子直接映射到 Apple 芯片架构 — perplexity_ai ·
- Perplexity 开源本地推理引擎 Lily,专为 Apple 芯片上的 Qwen3.6 打造 — perplexity_ai ·
- 【源头】Perplexity 开源本地推理引擎 Lily,专为 Apple 芯片上的 Qwen3.6 打造 — perplexity_ai · 2026-09-03
- Perplexity 开源 Lily 详解:hybrid compute 为何需要专用本地引擎 — perplexity_ai · 2026-09-03
- Perplexity 解释 Lily 设计:通用框架 vs 专用推理工作负载 — perplexity_ai · 2026-09-03
- 【源头】Lily 开源上线:把 Qwen 算子直接映射到 Apple 芯片架构 — perplexity_ai · 2026-09-03
- Perplexity 开源 Lily:Apple 芯片 Qwen 专用推理引擎,解码快 35% — inductionheads · 2026-09-03