Strata 两周实现 5-10 倍 prefill 提速,作者怒批 llama.cpp 守旧
Training_Visual6159 · reddit · 2026-10-03
Reddit 用户抱怨 llama.cpp 维护者一年来拒绝合并 MoE 缓存相关 PR,只有 1-2% 的零星优化;而新项目 Strata 仅用两周就实现了 5-10 倍 prefill 提速和 3-4 倍 decode 提速。
作者推荐的用法:Strata 相当于在 8-16GB 显卡 + 64GB 内存上跑类 Luna 级别模型,速度比 27B 模型更快或相当。项目地址:github.com/Niko1221/Strata
「Infra」频道最新
- 芯片设计组合空间达 10^260 万,AI 与 agents 把硬件变成搜索问题 — ai · 2026-10-03
- Redis 作者 antirez 发布 DwarfStar 4:MIT 许可本地推理引擎,KV 缓存可落盘 — petrusenko_max · 2026-10-03
- 899 美元 Mac Mini M6 被当上网本,其实是 24 小时 agentic 计算机器 — hey_abusiddik · 2026-10-03
- Modal VM 沙箱正式 GA:一套流程跑起 Docker Compose 应用、测试与编码 Agent — charles_irl · 2026-10-03
- 793 人社区投票:oMLX 以 55.5% 成最受欢迎的 Apple MLX 引擎 — HankYeomans · 2026-10-03
- 本地 AI 用户吐槽:为什么大家都甘当「驯兽师」,忍受复杂的折腾流程 — kathi7 · 2026-10-03