开源引擎 RunNburn:64G 内存桌面跑 295B MoE 模型,速度超 llama.cpp
coderredlab · hn · 2026-07-30
RunNburn 是一款基于 Rust 的开源 GGUF 推理引擎,专为在消费级硬件上运行超出显存/内存容量的超大模型而设计。
核心机制:
- 权重完全基于文件映射(mmap),严格限制主机内存占用(--ram-budget),GPU 缓存根据实际可用显存动态分配。
- 无需格式转换或静默重量化,磁盘上的 GGUF 文件即唯一事实来源。
- 利用 ODIRECT 和 iouring 按需批量读取选定的专家参数。
实测性能:
- 在配备 64GB 内存和单张消费级 NVIDIA 显卡的桌面上,成功运行腾讯 Hy3 模型(总参数 295B / 激活 21B,Q2K 量化文件达 97.8 GiB)。
- 在文件体积远超内存与显存总和的情况下,预热后解码速度达到约 5.5 tok/s,相比之下 llama.cpp 仅约 2.0 tok/s。
适用边界:对于能完全放入显存的模型,经过多年优化的 llama.cpp 依然更快。RunNburn 专注于运行“装不下”的超大模型,且目前不支持连续批处理和多租户吞吐。
「Infra」频道最新
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- Ramp 用本地模型省钱,引发业界对 AI 成本反思 — annetgriffin · 2026-08-24
- GitHub Actions 额度耗尽,是时候迁移到自建 VPS 了吗? — MicahBerkley · 2026-08-24
- Ubuntu 计划成为 RISC-V CPU 的参考操作系统 — bookwormengr · 2026-08-24