8GB 显存跑 35B 模型,伯克利推端侧 MoE 引擎 FreeToken
rohanpaul_ai · x · 2026-08-29
伯克利与德州大学发布 FreeToken 系统,通过带宽自适应执行优化端侧 MoE 模型推理。该系统通过动态映射计算与模型状态到可用资源,允许 8GB 游戏本以 39.3 t/s 运行 35B 模型,单工作站显卡甚至可跑 753B GLM-5.2,显著降低了本地运行前沿大模型的硬件门槛。
所属事件:伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2 条相关)→
「Infra」频道最新
- Lambda 获 10 亿美元债务购英伟达芯片 — himanshustwts · 2026-08-29
- RX 9070 XT 运行 ComfyUI 速度波动巨大 — bosox62 · 2026-08-29
- 开源 LLM 推理静态性能模型,支持多种缓存策略 — stanfordnlp · 2026-08-29
- 预测闭源前沿模型 2027 前变下载版,英伟达豪赌开源 — imjustnewatai · 2026-08-29
- 实测 Qwen3.8 在双节点 DGX 上达 181 tok/s 吞吐 — StartupTim · 2026-08-29
- Together 平台 24 小时处理 GLM-5.3 Flash 超 1350 亿 token — togethercompute · 2026-08-29