FreeToken 论文详解:端原生 MoE 推理系统设计
mark_k · x · 2026-08-23
FreeToken 是一个端原生 MoE 推理系统,旨在将个人设备转变为统一的弹性推理平台。该系统针对本地 AI 的两个现实进行了全栈协同设计:Agent 工作负载的执行模式持续变化,以及边缘硬件资源异构且不平衡。
FreeToken 没有采用固定的卸载策略,而是持续将计算和模型状态映射到实际可用的资源上。它支持 20 多种 MoE 模型,并能在从 8GB 笔记本 GPU 到单工作站 GPU 的不同硬件上运行真实的编码和工具使用 Agent。关键成果包括在笔记本上运行 35B 模型,在游戏桌面机上运行 284B 模型,以及在单工作站 GPU 上运行 753B GLM-5.2。
所属事件:伯克利MIT开源FreeToken:消费级PC本地跑前沿MoE大模型(11 条相关)→
「Infra」频道最新
- 传 OpenAI 推理芯片性能对标 GB300,对英伟达影响或有限 — ivan_bezdomny · 2026-08-25
- Lambda 征求模型卡片意见:是否需支持 NVFP4 权重与基座模型 — TheZachMueller · 2026-08-25
- Perplexity 发布 Spark 便携计算机研究 — AravSrinivas · 2026-08-25
- Arav Srinivas:端侧模型处理敏感文档至关重要,OCR 性能达 SOTA — AravSrinivas · 2026-08-25
- Arav Srinivas:受限于算力需转向本地 Agent — AravSrinivas · 2026-08-25
- 数据中心狂潮拉动美国天然气电厂建设潮,文中再批" alarming" 用词 — pstAsiatech · 2026-08-25