FreeToken:无大显存也能跑,消费级 PC 本地运行 290B+ MoE 模型
gnukeith · x · 2026-08-22
开源项目 FreeToken(FlashML-org)是一个面向边缘设备的 MoE 推理引擎,主打在普通游戏 PC(如 5090 + 大内存,无大 VRAM 要求)上以交互级速度本地运行 290B+ 参数的前沿开源 MoE 模型。
其核心思路是把 GPU、CPU、主机内存和互连等异构资源当作统一的弹性推理平台:包括带宽自适应的 CPU-GPU 协同执行(q 策略)、全层双缓冲 prefill 流式、全局 LRU 专家缓存、FTW 快速权重格式,以及基于语义锚点检查点的 KV 缓存等。项目已在 GitHub 获得近 300 star。
所属事件:伯克利MIT开源FreeToken 消费级显卡跑超大模型(3 条相关)→
「Infra」频道最新
- x402 协议用一行代码取代千个 API,开启链上代理支付 — 0xJeff · 2026-08-22
- 在 Intel NPU/iGPU 上运行 Phi-4 Mini 的实测 — Ecstatic-Wash-7667 · 2026-08-22
- 硅光波导损耗实测:低损耗氮化硅的猫腻 — jwt0625 · 2026-08-22
- llama.cpp 报错:Ling 3.0 Flash 模型加载出现大量 Unused Tensor — Debianreiser69 · 2026-08-22
- AMD 7900 XTX 遭遇闲置 5 秒后自动卸载模型 Bug — deathcom65 · 2026-08-22
- 云服务商偏好将推动开源与闭源融合 — iamtrask · 2026-08-22