伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型

伯克利与德州大学联合推出端侧推理引擎 FreeToken,旨在让普通设备流畅运行大模型。该系统针对现有引擎加载专家模型时 GPU 缓存固定的瓶颈,让 GPU 缓存跟随路由请求动态调整,并通过带宽自适应执行优化 MoE 模型推理,将计算与模型状态动态映射到可用资源。实测显示,配备 8GB 显存的游戏本可以约 39.3 token/s 的速度运行 35B 模型。

2026-08-29 ~ 2026-08-29 · 2 条相关

事件全程(共 2 集)→