伯克利开源 FreeToken:MoE 模型本地推理提速 2-4 倍,8GB 显卡跑 35B 模型

Roger_M_Taylor · x · 2026-08-25

UC Berkeley 开源了名为 FreeToken 的本地推理引擎,通过利用 Mixture-of-Experts (MoE) 架构,运行速度比 Ollama 快 2-4 倍。初步基准测试显示:Qwen3.6-35B 在 8GB GPU 上达到 39.3 tokens/s,DeepSeek-V4-Flash 284B 在 32GB GPU 上达到 22 tokens/s,GLM-5.2 753B 在 96GB GPU 上达到 14.9 tokens/s。通常 35B 模型需要 70GB 权重,但 FreeToken 通过只加载 MoE 路由器和动态分配内存到 CPU/PCIe,使 8GB GPU 即可运行。该架构对 agent 也有优势:编码 agent 频繁重写历史导致大量 prefill,FreeToken 在 agent 框架边界保存检查点,减少重复计算。

所属事件:伯克利开源 FreeToken:8GB 显存跑 290B MoE 模型(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →