FreeToken 开源:消费级硬件本地跑 290B+ MoE 模型
tom_doerr · x · 2026-09-30
开源项目 FreeToken(FlashML-org,已获 14k star)是一个面向边缘设备的 MoE 推理引擎,可在游戏 PC 等消费级硬件上以较快交互速度本地运行 290B+ 参数的开源权重 MoE 模型。核心思路是把 GPU、CPU、主机内存和互连接口当作统一弹性推理平台调度:采用带宽自适应的 CPU–GPU 协同执行策略(q policy)、全层双缓冲等技术,把数据中心级模型服务能力搬到桌面端。项目提供安装脚本、benchmark、论文链接与开发者社区。
「Infra」频道最新
- 不换模型也能省 AI 账单:五招优化 LLM 使用成本 — goyalshaliniuk · 2026-09-30
- DeepSeek 转用华为昇腾 950 训练模型 — WebAssemblyMan · 2026-09-30
- EnerTune 登 SOSP'26:推理能耗较 SOTA 降低 1.4–2.3 倍 — tianyin_xu · 2026-09-30
- SOSP'26 论文:面向能耗的 GPU 共享方案,重思推理服务利用率 — tianyin_xu · 2026-09-30
- SOSP'26 两篇系统论文:AI Agent 隔离数据流与 CXL 共享内存索引 — tianyin_xu · 2026-09-30
- DeepSeek 开源华为昇腾工具包, TileLang 支持瞄准 CUDA 替代 — kimmonismus · 2026-09-30