UC Berkeley/MIT 开源 FreeToken:数据中心级 MoE 推理搬上桌面
nilukush · reddit · 2026-09-04
UC Berkeley 与 MIT 的研究者(合著者含 Databricks 联合创始人 Matei Zaharia、Ion Stoica,以及 Song Han、Kurt Keutzer 等)开源了 FreeToken,一个把前沿 MoE 大模型带到消费级硬件的推理引擎。
- 问题:稀疏 MoE 每个 token 只激活少量参数,但解码需在数千亿非激活权重间路由;消费级硬件的 PCIe 带宽(16–64 GB/s)与内存延迟造成严重解码瓶颈。现有边缘运行时用静态专家卸载,缓存未命中时同步流式传输权重,执行完全停摆。
- q 动态协同调度:不在缓存未命中时暂停 GPU,而是按实时互连吞吐把 token 计算拆分到 CPU 核心与 GPU tensor core 上。
- FTW 快速权重格式 + 全层双缓冲:权重流式传输与活跃计算层完全重叠,隐藏 PCIe 传输开销。
- 弹性内存管理:运行时在 KV cache 与常驻专家槽位之间动态重分配显存,无需重载模型。
项目把个人机器从「受限数据中心节点」范式转变为「弹性异构计算织物」,已开源在 GitHub。
「Infra」频道最新
- Lightning AI 月报:Drive 数据持久化提速 200 倍,H100 开始换 H200e — LightningAI · 2026-09-04
- 推主连载科普 LLM 推理指标:TTFT、TPS、TPOT 到底在测什么 — abhijithneil · 2026-09-04
- LLM 推理科普连载:Prefill 并行读、Decode 逐 token 写的时间去哪了 — abhijithneil · 2026-09-04
- GPU 像千人工厂:逐 token 生成可能 1 人与 100 人利用率相同 — abhijithneil · 2026-09-04
- LLM 推理入门:带宽除以权重字节数,写代码前就能算出吞吐上限 — abhijithneil · 2026-09-04
- 语义缓存验证器红队测试:84% 对抗样本被放行,混入对抗数据降至 54% — Reasonable_Royal_621 · 2026-09-04