开源 Flyweight:单张显卡+内存跑超大 MoE,27B 量化解码 40 tok/s
Main-Wolverine-1042 · reddit · 2026-09-18
开发者发布 Flyweight,一个原生 C++/CUDA GGUF 推理引擎(Apache-2.0),让一张消费级 NVIDIA 卡+大内存就能跑超出显存的 MoE 模型:专家放 CPU,热集缓存在卡上,启动时自动判断加载方案,免去手动估算 offload 层数。提供 OpenAI/Anthropic 兼容 API 和聊天 UI。
实测(5070 Ti 12GB + 60GB RAM 笔记本):
- Qwen3.8-Flash-Next IQ1S:约 35 tok/s 解码 / 475 tok/s 预填充
- Qwen3.8-27B IQ2XXS:约 40 tok/s
- DeepSeek-V4-Flash:6–7 tok/s(逼近 DRAM 带宽极限)
- 同卡还可跑 Z-Image-Turbo 出图,1024x1024 约 15 秒
技术亮点:内核用 NVRTC 运行时编译,无需 nvcc;KV cache 支持 f16/q80/TurboQuant 4-bit(27B 在 32K 下解码速度差近一倍);工具调用由采样器语法强制约束,小量化下 Claude Code/opencode 稳定性明显提升;thinking budget 可硬性截断。作者坦承大量代码由 Claude Code 代写,自己负责设计与测试,所有内核有对照测试。项目在招贡献者(Ampere/Ada、AMD、macOS/ARM 均未验证),pip install flyweight-llm 即可装。
「Infra」频道最新
- Google、Nvidia、Anthropic 力推解锁 100GW,电力将成 AI 新瓶颈 — TansuYegen · 2026-09-18
- 华为将 AI 芯片 Ascend 960DT 提前至 2027 年初推出 — emmanuelvivier · 2026-09-18
- 补贴式编码订阅将收紧,按策略路由的 coding harness 是方向 — craigbalding · 2026-09-18
- 腾讯视频生成模型持续瘦身:编码器砍 7.5GB,新增 MLX 分支 — gaganghotra_ · 2026-09-18
- 开发者实测:AI 20 分钟完成移植工作,CUDA 护城河正在被侵蚀 — BringTea_666 · 2026-09-18
- 新半导体政策推出数月,印度获 120 亿美元投资承诺 — pstAsiatech · 2026-09-18