CPU 上 7B MoE 25 tok/s 的零成本方案

Annual_Manner_5901 · reddit · 2026-07-18

作者展示了自己基于 llama.cpp 打造的 CPU-first 推理服务器 Reame,并给出一个可直接在浏览器里访问的 live demo。

核心性能

零成本部署栈

系统设计

作者强调这个项目的原则是:在 CPU 上不要重复计算同一件事。

帖子最后还说明:这是单机单请求的免费 demo,OLMoE 目前也偏英语场景。

原文链接 →

「创投」频道最新

更多「创投」频道 AI 资讯 →