llama.cpp 加入 DSpark speculative decoding,征集速度实测
pmttyji · reddit · 2026-07-28
这条帖子指向 ggml-org/llama.cpp 的一个 PR:加入 DSpark speculative decoding。作者还明确邀请大家测试并分享吞吐量和 tokens/s 的提升数据。
它关注的是推理/runtime 层的性能优化,而不是模型能力本身;因此更适合归到基础设施方向。
「Infra」频道最新
- Nebius 推出本地 relay,把四种编程 Agent 接到开放模型 — HowDevelop · 2026-07-28
- GLM-5.2 已能在戴尔工作站本地跑到 40 tokens/s — pcuenq · 2026-07-28
- 黎曼流形上的二阶泰勒展开与 Hessian 定义 — FrnkNlsn · 2026-07-28
- Advantest 前景要看 Teradyne、TSMC 和 AI 测试链 — tengyanAI · 2026-07-28
- Teradyne 电话会将验证 AI 测试需求是否仍吃紧 — tengyanAI · 2026-07-28
- 铟磷化合物短缺加剧,VCSEL 扩产成关键变量 — zephyr_z9 · 2026-07-28