Perplexity 解释 Lily 设计:通用框架 vs 专用推理工作负载

perplexity_ai · x · 2026-09-03

Perplexity 在回复中进一步解释 Lily 的定位:hybrid compute 把任务拆分给云端模型和 Mac 上的本地模型,本地推理必须跟上整体任务节奏。

MLX-LM 是通用框架,而 Lily 是为这一特定推理负载量身定制的引擎,核心在于把 prefill(大量 token 一次处理、权重可复用)与 decode(逐 token 生成、复用少、吃内存带宽)区别对待。

所属事件:Perplexity 开源 Lily:Apple 芯片专用本地推理引擎(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →