Lily 开源上线:把 Qwen 算子直接映射到 Apple 芯片架构
perplexity_ai · x · 2026-09-03
Perplexity 发布 Lily 并开源,其设计理念是把 Apple 芯片当作独立的推理平台,将 Qwen 的算子直接映射到其计算与内存架构上。
GitHub 仓库(pplx-garden/lily,Rust 实现)要点:
- 面向单一 checkpoint 的 Metal 推理服务器:Qwen3.6-35B-A3B 的 MLX affine 4-bit 权重(group size 64)
- 暴露 OpenAI chat completions API 的最小子集,固定贪心解码
- Metal kernel 运行时从源码编译,无离线 shader 构建步骤
- 要求 Apple GPU family 10+(M5 及更新)、macOS 26+、Rust 1.92
- 加载时校验 35B-A3B 架构与量化布局,附基准报告与复现步骤
发布帖同时汇总了此前串内的跑分:Lily 在 M5 Max 上 prefill 吞吐较 MLX-LM 平均高 1.23 倍、decode 高 1.35 倍。
所属事件:Perplexity 开源 Lily:Apple 芯片专用本地推理引擎(6 条相关)→
「Infra」频道最新
- 博通预告 AI 营收 FY2027 翻倍至 1150 亿美元,FY2028 再翻倍到 2300 亿 — BenBajarin · 2026-09-03
- Perplexity 开源本地推理引擎 Lily,专为 Apple Silicon 优化 Qwen3.6 — inductionheads · 2026-09-03
- Nvidia 市值占标普 500 约 8%,达美国 GDP 的 16.3% — ivan_bezdomny · 2026-09-03
- 博通 Q3 AI 芯片营收 167 亿美元同比暴涨 221%,Q4 指引 217 亿 — Beth_Kindig · 2026-09-03
- 评测称 Claude Fable 5.1 将 agent 失败率砍半,单次正确答案成本 2.46 美元 — ryanshrout · 2026-09-03
- 安全公司 Bitbison 深度复盘 eBPF 性能陷阱:hook、CO-RE 与 ring buffer 实践 — tianyin_xu · 2026-09-03