FreeToken 框架:解码提速 4 倍,笔记本可跑 284B 模型

airesearch12 · x · 2026-08-22

FreeToken 是一个面向边缘设备的 MoE 模型推理系统,通过带宽自适应的 CPU-GPU 执行与跨 Agent 轮次的语义缓存,相比 Ollama 实现 3–4 倍的解码速度提升和 6–30 倍的预填充速度提升。

该系统将个人机器视为统一的弹性推理平台,动态映射计算与模型状态,而非依赖固定的卸载策略。实测显示,它能在 8GB 笔记本 GPU 上运行 35B 模型,在游戏台式机上运行 284B 模型,并在单张工作站 GPU 上运行 753B 的 GLM-5.2。

所属事件:伯克利MIT开源FreeToken:消费级显卡本地跑284B模型(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →