专题 · FULL STORY

FreeToken:8G显存本机跑35B大模型

伯克利Sky Lab联合MIT、德州大学等研究人员开源端侧推理引擎FreeToken,针对MoE模型专家加载时GPU缓存瓶颈进行优化,可在消费级PC上以8G显存流畅运行35B参数模型,项目开源后持续引发关注。

2026-08-22 ~ 2026-08-29 · 2 集 · 13 条

第 1 集 · 伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(2026-08-22,11 条)

UC Berkeley Sky Lab 联合 MIT 研究人员开源了面向边缘设备的 MoE 推理引擎 FreeToken(GitHub 组织 FlashML-org,论文 arXiv:2608.16157),主打让消费级 PC 无需大显存即可本地运行前沿开源 MoE 模型。官方与第三方初步实测数据方向一致、表现突出,社区开发者已开始贡献平台适配(如 Apple Silicon/MLX 支持),被视为开源推理生态对闭源托管服务的一次重要补位。

已确认

  • 官方发布帖来自 @YuchenjUW(UC Berkeley Sky Lab);@gnukeith、@solyarisoftware 与机器之心称项目由 UC Berkeley 与 MIT 研究人员合作开源。
  • 核心技术:带宽自适应的 CPU-GPU 执行、将 CPU/GPU/内存视为统一弹性系统并动态迁移 MoE 专家,以及跨 Agent 轮次的语义缓存;@markk 的论文详解补充,该系统针对 Agent 工作负载执行模式持续变化、边缘硬件资源异构且不平衡两个现实做了全栈协同设计。
  • 官方性能数据:相比 Ollama 实现约 3–4 倍解码速度提升、6–30 倍预填充速度提升;单张 RTX PRO 6000 工作站让 753B 的 GLM-5.2 跑到 14.9 tok/s;8GB 显存的 RTX 4060 笔记本运行 Qwen3.6 35B 达 39 tok/s(机器之心给出 39.3);RTX 5090 单卡以 25 tok/s 运行 DeepSeek-V4-Flash 284B,比 llama.cpp 快 1.46 倍。
  • 社区实测与生态参与:@ViRROOO 在 RTX 5080(16GB 显存)+ 64GB DDR6 内存的本地环境初步测试,报告 4090 级显卡跑 35B 模型可达约 100 tok/s;@jasonkneen 为 FreeToken 提交了 Apple Silicon/Metal/MLX 支持的 PR,显示项目开始吸引第三方平台适配贡献。
  • @gnukeith 补充:普通游戏 PC(如 5090 + 大内存、无大 VRAM 要求)即可本地运行 290B+ 参数的 MoE 模型,达到交互级速度。

尚未确认

  • 各项基准主要来自官方与少数第三方初步测试,@ViRROOO 亦称仅为初步结果,不同硬件配置(尤其非 NVIDIA 平台)下的独立复现与长期稳定性尚待验证。

为什么重要

  • 该项目把「本地跑前沿开源 MoE 模型」的门槛降到千元级 4060 笔记本与普通游戏 PC;@berkeleyai 甚至称优化后前端模型服务成本可归零,消费者级 GPU 已能以前沿模型速度提供本地服务。
  • 对隐私敏感、离线及成本受限场景(个人 Agent、边缘部署)有直接意义;第三方实测与官方数据方向一致,且已有开发者主动贡献新平台支持,增强可信度,但仍需更多独立复现。

第 2 集 · 伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2026-08-29,2 条)

伯克利与德州大学联合推出端侧推理引擎 FreeToken,旨在让普通设备流畅运行大模型。该系统针对现有引擎加载专家模型时 GPU 缓存固定的瓶颈,让 GPU 缓存跟随路由请求动态调整,并通过带宽自适应执行优化 MoE 模型推理,将计算与模型状态动态映射到可用资源。实测显示,配备 8GB 显存的游戏本可以约 39.3 token/s 的速度运行 35B 模型。