FreeToken 引擎:8G 显存本机流畅跑 35B 模型
rohanpaul_ai · x · 2026-08-29
伯克利与德州大学推出 FreeToken 推理引擎,旨在让普通设备流畅运行大模型。它解决了现有引擎在加载专家模型时 GPU 缓存固定的瓶颈,通过让 GPU 缓存跟随路由请求动态调整,将未命中专家率从 llama.cpp 的 62% 降至 16%。
- 性能表现:配备 8GB 显存的游戏本可以 39.3 tokens/秒的速度运行 35B 模型,速度超过生产环境中的 Codex。
- 核心技术:不再在加载时固定专家位置,而是根据实际路由请求动态缓存;其余部分根据 PCIe 和内存速度自动分配在 GPU 和系统 RAM 间运行,避免硬件空等。
所属事件:伯克利等推出 FreeToken,8G 显存本机流畅跑 35B 模型(2 条相关)→
「Infra」频道最新
- 分析师更新超大规模云与 neocloud 软件能力版图 — BenBajarin · 2026-08-29
- 开源工具 Amallo:一键远程访问本地 Ollama — tehfonsi · 2026-08-29
- 预测市场:年底前 68% 概率有州颁布数据中心禁令 — Polymarket · 2026-08-29
- Conifer SDK 开源:统一推理网关与计费 — ycombinator · 2026-08-29
- MiniMax H3 Max 视频生成快 24 倍,刷新帕累托前沿 — JenniferHli · 2026-08-29
- AMD/Intel 显卡跑图/视频性能如何?求对比 RTX 3090/4090 — ElvenNinja · 2026-08-29