伯克利MIT开源FreeToken 消费级显卡跑超大模型

UC Berkeley Sky Lab 与 MIT 研究人员开源 MoE 推理引擎 FreeToken(FlashML-org),主打在消费级硬件上本地运行超大模型:单张 RTX PRO 6000 工作站可跑 753B 的 GLM 模型,RTX 5090 能以 25 tok/s 运行 DeepSeek-V4,普通游戏 PC 配大内存、无大显存要求即可交互式运行 290B+ MoE 模型,大幅降低本地部署门槛。

2026-08-22 ~ 2026-08-22 · 3 条相关