Perplexity 解释 Lily 设计:通用框架 vs 专用推理工作负载
perplexity_ai · x · 2026-09-03
Perplexity 在回复中进一步解释 Lily 的定位:hybrid compute 把任务拆分给云端模型和 Mac 上的本地模型,本地推理必须跟上整体任务节奏。
MLX-LM 是通用框架,而 Lily 是为这一特定推理负载量身定制的引擎,核心在于把 prefill(大量 token 一次处理、权重可复用)与 decode(逐 token 生成、复用少、吃内存带宽)区别对待。
所属事件:Perplexity 开源 Lily:Apple 芯片专用本地推理引擎(6 条相关)→
「Infra」频道最新
- 博通预告 AI 营收 FY2027 翻倍至 1150 亿美元,FY2028 再翻倍到 2300 亿 — BenBajarin · 2026-09-03
- Perplexity 开源本地推理引擎 Lily,专为 Apple Silicon 优化 Qwen3.6 — inductionheads · 2026-09-03
- Nvidia 市值占标普 500 约 8%,达美国 GDP 的 16.3% — ivan_bezdomny · 2026-09-03
- 博通 Q3 AI 芯片营收 167 亿美元同比暴涨 221%,Q4 指引 217 亿 — Beth_Kindig · 2026-09-03
- 评测称 Claude Fable 5.1 将 agent 失败率砍半,单次正确答案成本 2.46 美元 — ryanshrout · 2026-09-03
- 安全公司 Bitbison 深度复盘 eBPF 性能陷阱:hook、CO-RE 与 ring buffer 实践 — tianyin_xu · 2026-09-03