伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型
伯克利与德州大学联合推出端侧推理引擎 FreeToken,旨在让普通设备流畅运行大模型。该系统针对现有引擎加载专家模型时 GPU 缓存固定的瓶颈,让 GPU 缓存跟随路由请求动态调整,并通过带宽自适应执行优化 MoE 模型推理,将计算与模型状态动态映射到可用资源。实测显示,配备 8GB 显存的游戏本可以约 39.3 token/s 的速度运行 35B 模型。
2026-08-29 ~ 2026-08-29 · 2 条相关
- 第 1 集:伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(2026-08-22,11 条)
- 第 2 集:伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2026-08-29,2 条)
- FreeToken 引擎:8G 显存本机流畅跑 35B 模型 — rohanpaul_ai · 2026-08-29
- 8GB 显存跑 35B 模型,伯克利推端侧 MoE 引擎 FreeToken — rohanpaul_ai · 2026-08-29