Rust/CUDA 推理引擎 reflex 支持 DeepSeek MLA,冷启动比 llama.cpp 快 1.3 倍

SaveAmerica2024 · reddit · 2026-09-24

开发者开源了 GGUF 原生的 Rust/CUDA 推理引擎 reflex(MIT 协议),设计目标与 llama.cpp/vLLM 不同:优化冷启动延迟(进程启动到首 token)而非稳态吞吐。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →