llama.cpp 合并 GLM-5.2 的 speculative decoding 支持
YPSONDESIGN · reddit · 2026-07-29
llama.cpp 合并了一项 PR,为 GLMDSA(GLM-5.2) 增加了 NextN/MTP speculative decoding 支持。
- 这类改动会直接影响一个常用本地推理栈的模型推理能力。
- speculative decoding 的目标是通过更高效地验证候选 token,提升生成吞吐并降低延迟。
- 由于它已经合并进 llama.cpp,这不仅是编程/Agent 场景的实用更新,也和本地推理性能、推理优化密切相关。
「编程与Agent」频道最新
- 5 个开源工具让 Claude 和 Codex 智能体少用 60% 到 95% token — CodeByPoonam · 2026-07-29
- Codex Micro 应改成语音优先,Git 和 PR 控件取代批准按钮 — rudrank · 2026-07-29
- Agent 团队评估应先规则校验,再用 LLM judge,最后人工复核 — yoobinray · 2026-07-29
- Matt Pocock 把路径地图做成 Cmd+K 面板规格 — mattpocockuk · 2026-07-29
- GitHub 规格说明把图形编辑器做成 Cmd+K 命令面板 — mattpocockuk · 2026-07-29
- Codex 现在也能做基础视频剪辑:裁切、字幕、打码和标题卡 — gabrielchua · 2026-07-29