Nebius 称 SlimSpec 在不缩词表下提速 8% 至 9%

Arindam_1729 · x · 2026-07-21

Nebius 的 Token Factory 发布了新的 SlimSpec speculative decoding 优化方案,主打“不裁词表也能更快”。

帖子给出的结果是:SlimSpec 将 LM-head 成本降低 4–5 倍,同时保留完整词表;相对基线,端到端速度最高可提升 8–9%。作者强调这带来的价值是更高的生产吞吐,即同样的模型可以更高效地服务更多 token。

配图也在强调同一个卖点:不是改模型能力,而是改推理/服务栈的效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →