FreeToken 引擎:8G 显存本机流畅跑 35B 模型

rohanpaul_ai · x · 2026-08-29

伯克利与德州大学推出 FreeToken 推理引擎,旨在让普通设备流畅运行大模型。它解决了现有引擎在加载专家模型时 GPU 缓存固定的瓶颈,通过让 GPU 缓存跟随路由请求动态调整,将未命中专家率从 llama.cpp 的 62% 降至 16%。

所属事件:伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →