8GB 显存跑 35B 模型,伯克利推端侧 MoE 引擎 FreeToken

rohanpaul_ai · x · 2026-08-29

伯克利与德州大学发布 FreeToken 系统,通过带宽自适应执行优化端侧 MoE 模型推理。该系统通过动态映射计算与模型状态到可用资源,允许 8GB 游戏本以 39.3 t/s 运行 35B 模型,单工作站显卡甚至可跑 753B GLM-5.2,显著降低了本地运行前沿大模型的硬件门槛。

所属事件:伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →