Lily 跑分:M5 Max 上预填吞吐高 MLX-LM 23%,解码高 35%
perplexity_ai · x · 2026-09-03
Perplexity 公布 Lily 引擎在 M5 Max MacBook Pro 上运行 Qwen3.6-35B-A3B 的基准结果:
- 在 10 种 prompt 长度 × 10 种解码上下文的组合下,Lily 全面快于 MLX-LM
- 平均 prefill 吞吐高 1.23 倍,decode 吞吐高 1.35 倍
- 输出质量基本不变
核心技术思路:将 prefill 与 decode 视为本质不同的工作负载——prefill 一次处理大量 prompt token、可跨 token 复用权重;decode 逐 token 生成、复用少,内存流量与带宽更关键。
「Infra」频道最新
- llama.cpp 弃用 --chat-template-kwargs,推理保留默认开启 — Bulky-Priority6824 · 2026-09-03
- Agentic API:在 vLLM 前加有状态层,把编排从客户端搬进服务端 — techNmak · 2026-09-03
- Google 发布 Gemini 3.8 Flash:干得更多但可能花更多 token — The Verge AI · 2026-09-03
- Mitchell Hashimoto 公开 Superlogical 服务器内存优化实录 — sull · 2026-09-03
- Perplexity 开源本地推理引擎 Lily,专为 Apple 芯片上的 Qwen3.6 打造 — perplexity_ai · 2026-09-03
- FastH3 实现本地推理:支持 Apple Silicon 与 DGX Spark — Vandy_simp · 2026-09-03