开源 Flyweight:单张显卡+内存跑超大 MoE,27B 量化解码 40 tok/s

Main-Wolverine-1042 · reddit · 2026-09-18

开发者发布 Flyweight,一个原生 C++/CUDA GGUF 推理引擎(Apache-2.0),让一张消费级 NVIDIA 卡+大内存就能跑超出显存的 MoE 模型:专家放 CPU,热集缓存在卡上,启动时自动判断加载方案,免去手动估算 offload 层数。提供 OpenAI/Anthropic 兼容 API 和聊天 UI。

实测(5070 Ti 12GB + 60GB RAM 笔记本):

技术亮点:内核用 NVRTC 运行时编译,无需 nvcc;KV cache 支持 f16/q80/TurboQuant 4-bit(27B 在 32K 下解码速度差近一倍);工具调用由采样器语法强制约束,小量化下 Claude Code/opencode 稳定性明显提升;thinking budget 可硬性截断。作者坦承大量代码由 Claude Code 代写,自己负责设计与测试,所有内核有对照测试。项目在招贡献者(Ampere/Ada、AMD、macOS/ARM 均未验证),pip install flyweight-llm 即可装。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →