Rust/CUDA 推理引擎 reflex 支持 DeepSeek MLA,冷启动比 llama.cpp 快 1.3 倍
SaveAmerica2024 · reddit · 2026-09-24
开发者开源了 GGUF 原生的 Rust/CUDA 推理引擎 reflex(MIT 协议),设计目标与 llama.cpp/vLLM 不同:优化冷启动延迟(进程启动到首 token)而非稳态吞吐。
- 模型支持:完整实现 DeepSeek-V2/V3 的 Multi-head Latent Attention(已对照真实 DeepSeek-V2-Lite 权重验证),另支持 Qwen3 稠密、Qwen3-MoE 及 Qwen3.5 混合 Gated DeltaNet。
- 性能:所有 kernel 由 nvcc 构建期 AOT 编译,无 NVRTC 首次使用开销;A6000 上冷启动比 llama.cpp 快约 1.3-1.4 倍(权重一次上传、GPU 上反量化);vLLM 冷启动慢 24-52 倍(作者注明该对比不完全公平)。
- 特色 System1 模式:单次前向对多个候选续写打分输出概率(如候选词打分 Paris: 0.997),适合 agent 决策循环中从已知选项中挑选。
- 定位为嵌入式/一次性执行(C-FFI + Python 绑定),batchsize 恒为 1,无服务模式,仅 GPU。
「编程与Agent」频道最新
- YC 总裁 Garry Tan 实测 Capy:并行编排效率比裸用 Codex 快 4 倍 — garrytan · 2026-09-24
- Zilliz CTO:Agent 让企业数据层问题无处遁形 — No_Engineer_1224 · 2026-09-24
- $0.072/时的16GB云VM跑Android模拟器+Chrome,常驻Agent工作流新选择 — cem2ran · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- 把 Jev 接进 Mythic:用大模型给红队命令的 OPSEC 强度打分 — dyn___ · 2026-09-24
- Ethan Mollick 用 Claude 多智能体协作复刻童年老游戏 Rescue Raiders — emollick · 2026-09-24