FreeToken 框架:解码提速 4 倍,笔记本可跑 284B 模型
airesearch12 · x · 2026-08-22
FreeToken 是一个面向边缘设备的 MoE 模型推理系统,通过带宽自适应的 CPU-GPU 执行与跨 Agent 轮次的语义缓存,相比 Ollama 实现 3–4 倍的解码速度提升和 6–30 倍的预填充速度提升。
该系统将个人机器视为统一的弹性推理平台,动态映射计算与模型状态,而非依赖固定的卸载策略。实测显示,它能在 8GB 笔记本 GPU 上运行 35B 模型,在游戏台式机上运行 284B 模型,并在单张工作站 GPU 上运行 753B 的 GLM-5.2。
所属事件:伯克利MIT开源FreeToken:消费级显卡本地跑284B模型(4 条相关)→
「Infra」频道最新
- Ox Alpha 每天送出 100T tokens:算力成本达百万美元级 — teortaxesTex · 2026-08-22
- 企业 OpenAI 账单失控,求荐统一 AI 网关方案 — HurryOrganic · 2026-08-22
- Agent 静默失败跑出 4.7 万账单,传统监控已失效 — alifgokce · 2026-08-22
- 反数据中心运动是人类意识到正在制造继任者的恐惧 — ZeroStateReflex · 2026-08-22
- llama.cpp 能否跨卡共享 KV 缓存处理多请求? — spaceman_ · 2026-08-22
- GLM-5.2 本地推理测试: ubatch 对 MoE 性能影响巨大 — fuzhongkai · 2026-08-22