伯克利开源 FreeToken:MoE 模型本地推理提速 2-4 倍,8GB 显卡跑 35B 模型
Roger_M_Taylor · x · 2026-08-25
UC Berkeley 开源了名为 FreeToken 的本地推理引擎,通过利用 Mixture-of-Experts (MoE) 架构,运行速度比 Ollama 快 2-4 倍。初步基准测试显示:Qwen3.6-35B 在 8GB GPU 上达到 39.3 tokens/s,DeepSeek-V4-Flash 284B 在 32GB GPU 上达到 22 tokens/s,GLM-5.2 753B 在 96GB GPU 上达到 14.9 tokens/s。通常 35B 模型需要 70GB 权重,但 FreeToken 通过只加载 MoE 路由器和动态分配内存到 CPU/PCIe,使 8GB GPU 即可运行。该架构对 agent 也有优势:编码 agent 频繁重写历史导致大量 prefill,FreeToken 在 agent 框架边界保存检查点,减少重复计算。
所属事件:伯克利开源 FreeToken:8GB 显存跑 290B MoE 模型(4 条相关)→
「Infra」频道最新
- 开源 RAG 技术栈全解析:从数据摄入到前端部署 — goyalshaliniuk · 2026-08-25
- 英两数据中心碳排放将超埃克森美孚,引气候担忧 — nordicinst · 2026-08-25
- AI 内存的下一个前沿是什么? — boneMechBoy69420 · 2026-08-25
- 机器人演示卡顿?FlashRT 实时推理引擎 Hz 级延迟评测 — Xianbao_QIAN · 2026-08-25
- AI 芯片商燧原科技启动近 9 亿美元上海 IPO 认购 — pstAsiatech · 2026-08-25
- 台湾起诉9人:74台Nvidia B300服务器涉伪造文件走私入华 — kimmonismus · 2026-08-25