开源引擎 RunNburn:64G 内存桌面跑 295B MoE 模型,速度超 llama.cpp

coderredlab · hn · 2026-07-30

RunNburn 是一款基于 Rust 的开源 GGUF 推理引擎,专为在消费级硬件上运行超出显存/内存容量的超大模型而设计。

核心机制:

实测性能:

适用边界:对于能完全放入显存的模型,经过多年优化的 llama.cpp 依然更快。RunNburn 专注于运行“装不下”的超大模型,且目前不支持连续批处理和多租户吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →