开源 Rust 推理引擎 runNburn:内存受限下跑 295B 模型,短上下文解码比 llama.cpp 快 2.8 倍
coderyeon · reddit · 2026-07-31
开发者 coderyeon 在 Reddit 分享其开源项目 runNburn,一个用 Rust 编写的 GGUF 模型推理运行时,专为内存受限场景设计。它支持 CPU、CUDA、Metal 和 Android,实验性支持 Vulkan 和 OpenCL。核心特点是显式内存预算管理:权重文件映射、主机驻留受限、加速器缓存按硬件大小调整,不重新量化或转换模型。
性能亮点:
- 桌面端:在 64GB RAM + RTX 3090 上运行腾讯 Hy3 295B-A21B(97.8 GiB Q2K/Q3K GGUF),短上下文解码速度 5.513 tok/s,是 llama.cpp 的 2.8 倍,prefill 快 7.3 倍;长上下文仍受页面错误限制。
- 移动端:在 8GB Galaxy Z Flip4 上运行 Qwen3.6 35B-A3B,端到端耗时比 MNN 快 2.11 倍(63.2s vs 133.5s),解码快 2.33 倍。
项目始于 2026 年 3 月,最初为手机优化,现已支持多种架构(密集注意力、GatedDeltaNet、Mamba、稀疏 MoE)。目标是个人单用户推理服务器,非高吞吐多租户系统。
「Infra」频道最新
- 大型科技公司AI支出总额突破1万亿美元 — gaganghotra_ · 2026-07-31
- 探秘投机解码的“有损验证”:机制、权衡与失败模式 — Tianyu Wang · 2026-07-31
- 单次AI提问与智能体工作流能耗相差十万倍 — AndyMasley · 2026-07-31
- AI 算力交易日益依赖借贷资金,贷款方正重新评估风险定价 — haipothetical · 2026-07-31
- UBS 图表揭示 AI 算力供应链的核心枢纽格局 — BenBajarin · 2026-07-31
- 凑齐512GB显存:开发者组装双机8卡V100推理集群 — UltraFOV · 2026-07-31