LiquidAI 新模型实测:Mac 本地跑 128K 上下文解码达 82 tok/s

helloiamleonie · x · 2026-08-05

LiquidAI 发布了专为智能体和编程工作流设计的 LFM2.5-2.6B 模型。该模型支持 128K 上下文,且完全适配设备端本地运行。\n\n在 M5 Max(48GB)设备上使用本地推理工具 Nativ(无量化 bf16 精度)进行实测,该模型展现出优异的性能:预填充速度达 11,231 tok/s,解码速度达 82 tok/s。同时,跑满 128K 上下文仅占用 8.5GB 内存,在 batch 16 的聚合解码下可达 476 tok/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →