FreeToken:无大显存也能跑,消费级 PC 本地运行 290B+ MoE 模型

gnukeith · x · 2026-08-22

开源项目 FreeToken(FlashML-org)是一个面向边缘设备的 MoE 推理引擎,主打在普通游戏 PC(如 5090 + 大内存,无大 VRAM 要求)上以交互级速度本地运行 290B+ 参数的前沿开源 MoE 模型。

其核心思路是把 GPU、CPU、主机内存和互连等异构资源当作统一的弹性推理平台:包括带宽自适应的 CPU-GPU 协同执行(q 策略)、全层双缓冲 prefill 流式、全局 LRU 专家缓存、FTW 快速权重格式,以及基于语义锚点检查点的 KV 缓存等。项目已在 GitHub 获得近 300 star。

所属事件:伯克利MIT开源FreeToken 消费级显卡跑超大模型(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →