FreeToken 系统让 RTX4060 笔记本流畅跑 35B 大模型
机器之心 · wechat · 2026-08-22
核心成果
UC Berkeley、MIT 等团队联合开源了端侧推理系统 FreeToken,专为 MoE(混合专家)模型设计。它打破了硬件门槛,使得笔记本 RTX4060 可运行 Qwen3.6-35B(39.3 token/s),桌面 RTX5090 可运行 DeepSeek-V4-Flash(284B 参数),且均为单卡满血版。
技术亮点
- 全层双缓冲:计算与数据搬运完全重叠,消除 I/O 等待气泡。
- 带宽自适应混合调度:实时探测 PCIe 带宽与 CPU 算力,动态分配 GPU 与 CPU 的计算任务,将吞吐拉满。
- 面向 Agent 的状态复用:在 Token 边界设轻量级检查点,上下文修改时仅从最近锚点增量恢复,减少 65-80% 的首 Token 延迟(TTFT)。
- 弹性显存热扩缩容:后台应用抢占显存时,自动收缩 GPU Cache,将计算转交 CPU,保证服务不中断(0 停机开销)。
解决的痛点
- 传统 CPU-GPU 权重卸载受 PCIe 带宽限制,速度极慢;FreeToken 实现了“交互级实用速度”。
- 解决了 MoE 模型 Prefill 阶段稀疏性被破坏导致的 I/O 阻塞问题。
- 无需死磕 100% 显存,利用 CPU 内存+PCIe 通道实现高性价比本地部署。
实用性
- 已提供 Windows/Linux 桌面 App 及 CLI。
- 证明了让大模型普及的关键不仅是权重开源,更是端侧调度系统的工程重构。
所属事件:伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(11 条相关)→
「Infra」频道最新
- ClickHouse年营收破3.5亿美元,OpenAI用量一年涨10倍 — iamKierraD · 2026-08-25
- 马斯克:五年后太空 AI 算力将超地球累计总量 — r0ck3t23 · 2026-08-25
- 传 OpenAI 推理芯片性能对标 GB300,对英伟达影响或有限 — ivan_bezdomny · 2026-08-25
- Lambda 征求模型卡片意见:是否需支持 NVFP4 权重与基座模型 — TheZachMueller · 2026-08-25
- Perplexity 发布 Spark 便携计算机研究 — AravSrinivas · 2026-08-25
- Arav Srinivas:端侧模型处理敏感文档至关重要,OCR 性能达 SOTA — AravSrinivas · 2026-08-25