llama.cpp 加入 DSpark speculative decoding,征集速度实测

pmttyji · reddit · 2026-07-28

这条帖子指向 ggml-org/llama.cpp 的一个 PR:加入 DSpark speculative decoding。作者还明确邀请大家测试并分享吞吐量和 tokens/s 的提升数据。

它关注的是推理/runtime 层的性能优化,而不是模型能力本身;因此更适合归到基础设施方向。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →