专题 · FULL STORY
FreeToken:8G显存本机跑35B大模型
伯克利Sky Lab联合MIT、德州大学等研究人员开源端侧推理引擎FreeToken,针对MoE模型专家加载时GPU缓存瓶颈进行优化,可在消费级PC上以8G显存流畅运行35B参数模型,项目开源后持续引发关注。
2026-08-22 ~ 2026-08-29 · 2 集 · 13 条
第 1 集 · 伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(2026-08-22,11 条)
UC Berkeley Sky Lab 联合 MIT 研究人员开源了面向边缘设备的 MoE 推理引擎 FreeToken(GitHub 组织 FlashML-org,论文 arXiv:2608.16157),主打让消费级 PC 无需大显存即可本地运行前沿开源 MoE 模型。官方与第三方初步实测数据方向一致、表现突出,社区开发者已开始贡献平台适配(如 Apple Silicon/MLX 支持),被视为开源推理生态对闭源托管服务的一次重要补位。
已确认
- 官方发布帖来自 @YuchenjUW(UC Berkeley Sky Lab);@gnukeith、@solyarisoftware 与机器之心称项目由 UC Berkeley 与 MIT 研究人员合作开源。
- 核心技术:带宽自适应的 CPU-GPU 执行、将 CPU/GPU/内存视为统一弹性系统并动态迁移 MoE 专家,以及跨 Agent 轮次的语义缓存;@markk 的论文详解补充,该系统针对 Agent 工作负载执行模式持续变化、边缘硬件资源异构且不平衡两个现实做了全栈协同设计。
- 官方性能数据:相比 Ollama 实现约 3–4 倍解码速度提升、6–30 倍预填充速度提升;单张 RTX PRO 6000 工作站让 753B 的 GLM-5.2 跑到 14.9 tok/s;8GB 显存的 RTX 4060 笔记本运行 Qwen3.6 35B 达 39 tok/s(机器之心给出 39.3);RTX 5090 单卡以 25 tok/s 运行 DeepSeek-V4-Flash 284B,比 llama.cpp 快 1.46 倍。
- 社区实测与生态参与:@ViRROOO 在 RTX 5080(16GB 显存)+ 64GB DDR6 内存的本地环境初步测试,报告 4090 级显卡跑 35B 模型可达约 100 tok/s;@jasonkneen 为 FreeToken 提交了 Apple Silicon/Metal/MLX 支持的 PR,显示项目开始吸引第三方平台适配贡献。
- @gnukeith 补充:普通游戏 PC(如 5090 + 大内存、无大 VRAM 要求)即可本地运行 290B+ 参数的 MoE 模型,达到交互级速度。
尚未确认
- 各项基准主要来自官方与少数第三方初步测试,@ViRROOO 亦称仅为初步结果,不同硬件配置(尤其非 NVIDIA 平台)下的独立复现与长期稳定性尚待验证。
为什么重要
- 该项目把「本地跑前沿开源 MoE 模型」的门槛降到千元级 4060 笔记本与普通游戏 PC;@berkeleyai 甚至称优化后前端模型服务成本可归零,消费者级 GPU 已能以前沿模型速度提供本地服务。
- 对隐私敏感、离线及成本受限场景(个人 Agent、边缘部署)有直接意义;第三方实测与官方数据方向一致,且已有开发者主动贡献新平台支持,增强可信度,但仍需更多独立复现。
- 伯克利开源 FreeToken:千元的 4060 笔记本跑 35B 模型 — Yuchenj_UW · 2026-08-22
- 伯克利MIT开源推理引擎:RTX 5090单卡可跑284B模型 — gnukeith · 2026-08-22
- FreeToken:无大显存也能跑,消费级 PC 本地运行 290B+ MoE 模型 — gnukeith · 2026-08-22
- FreeToken 框架:解码提速 4 倍,笔记本可跑 284B 模型 — airesearch12 · 2026-08-22
- FreeToken 实测:4090级显卡跑35B模型达100 tok/s — ViRROOO · 2026-08-22
- 前端模型服务成本归零,8GB 显卡运行 Qwen3.6 — berkeley_ai · 2026-08-22
- 伯克利 MIT 推 FreeToken:消费级 GPU 跑 284B 模型 — solyarisoftware · 2026-08-22
- FreeToken 系统让 RTX4060 笔记本流畅跑 35B 大模型 — 机器之心 · 2026-08-22
- FreeToken 助力本地 AI,8G 显存笔记本可跑 35B 模型 — mark_k · 2026-08-23
- FreeToken 论文详解:端原生 MoE 推理系统设计 — mark_k · 2026-08-23
- FreeToken 实测数据:单张 RTX PRO 6000 跑 753B 模型 — jasonkneen · 2026-08-23
第 2 集 · 伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2026-08-29,2 条)
伯克利与德州大学联合推出端侧推理引擎 FreeToken,旨在让普通设备流畅运行大模型。该系统针对现有引擎加载专家模型时 GPU 缓存固定的瓶颈,让 GPU 缓存跟随路由请求动态调整,并通过带宽自适应执行优化 MoE 模型推理,将计算与模型状态动态映射到可用资源。实测显示,配备 8GB 显存的游戏本可以约 39.3 token/s 的速度运行 35B 模型。
- FreeToken 引擎:8G 显存本机流畅跑 35B 模型 — rohanpaul_ai · 2026-08-29
- 8GB 显存跑 35B 模型,伯克利推端侧 MoE 引擎 FreeToken — rohanpaul_ai · 2026-08-29