Strata 两周实现 5-10 倍 prefill 提速,作者怒批 llama.cpp 守旧

Training_Visual6159 · reddit · 2026-10-03

Reddit 用户抱怨 llama.cpp 维护者一年来拒绝合并 MoE 缓存相关 PR,只有 1-2% 的零星优化;而新项目 Strata 仅用两周就实现了 5-10 倍 prefill 提速和 3-4 倍 decode 提速。

作者推荐的用法:Strata 相当于在 8-16GB 显卡 + 64GB 内存上跑类 Luna 级别模型,速度比 27B 模型更快或相当。项目地址:github.com/Niko1221/Strata

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →