Lily 跑分:M5 Max 上预填吞吐高 MLX-LM 23%,解码高 35%

perplexity_ai · x · 2026-09-03

Perplexity 公布 Lily 引擎在 M5 Max MacBook Pro 上运行 Qwen3.6-35B-A3B 的基准结果:

核心技术思路:将 prefill 与 decode 视为本质不同的工作负载——prefill 一次处理大量 prompt token、可跨 token 复用权重;decode 逐 token 生成、复用少,内存流量与带宽更关键。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →