开源 Rust 推理引擎 runNburn:内存受限下跑 295B 模型,短上下文解码比 llama.cpp 快 2.8 倍

coderyeon · reddit · 2026-07-31

开发者 coderyeon 在 Reddit 分享其开源项目 runNburn,一个用 Rust 编写的 GGUF 模型推理运行时,专为内存受限场景设计。它支持 CPU、CUDA、Metal 和 Android,实验性支持 Vulkan 和 OpenCL。核心特点是显式内存预算管理:权重文件映射、主机驻留受限、加速器缓存按硬件大小调整,不重新量化或转换模型。

性能亮点:

项目始于 2026 年 3 月,最初为手机优化,现已支持多种架构(密集注意力、GatedDeltaNet、Mamba、稀疏 MoE)。目标是个人单用户推理服务器,非高吞吐多租户系统。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →