FreeToken:让笔记本跑 35B、单卡 GPU 跑 753B 模型的边缘 MoE 推理系统
青稞AI · wechat · 2026-10-09
UC Berkeley、MIT 等团队推出面向边缘设备原生设计的 MoE 推理服务系统 FreeToken,已在 flashml.ai 开源。它不再把个人电脑视为小型 GPU,而是建模为统一、弹性伸缩的推理平台,针对 agent 类负载动态变化和边缘硬件异构两大现实特征做全栈协同设计。
- 关键机制:动态专家驻留策略、CPU–GPU 协同执行、agent 状态复用、运行时内存管理,不预先固化卸载策略
- 支持 20 多种 MoE 模型,从 8GB 显存笔记本到工作站单卡均可运行代码生成与工具调用 agent
- 实际部署能力:普通笔记本跑 35B 参数模型,高端游戏台式机跑 284B,单卡工作站 GPU 直接跑 753B 的 GLM 模型
青稞社区将于 10 月 11 日邀请第一作者、Berkeley EECS 博士生杨硕直播讲解系统架构与设计理念。
「Infra」频道最新
- 网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒 — HankYeomans · 2026-10-10
- vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍 — vllm_project · 2026-10-10
- vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10
- AMD 联手 ai& 办东京黑客松:4.5 小时用 Kimi、GLM、Qwen、MiniMax 搭建 — DavidBennett__ · 2026-10-10
- 芝加哥市中心将建 AI 数据中心,空置写字楼迎来新用途 — willcb · 2026-10-10
- 开源 sparkDash 2.0:私有化 GPU token 工厂的产能看板 — aigclink · 2026-10-10