本地推理慢?推测解码用小模型起草、大模型批量验证

HowDevelop · x · 2026-09-17

本地推理解决了隐私与成本问题,但每个 token 都要完整跑一遍大模型前向传播,长文本和复杂推理场景下速度瓶颈明显。

推测解码改变了这笔账:由一个更小更快的草稿模型提前提出 4-8 个 token,大模型(目标模型)一次批量前向验证,只接受它本来也会生成的 token——结果是用约一次前向的代价换来多个 token,质量完全一致但输出更快。

但有前提:不是任意两个模型组合都能加速,必须满足三点——共享 tokenizer(硬性要求,不同 tokenizer 会彻底破坏流程)、同模型家族(如 Qwen3-30B 目标 + Qwen3-0.6B 草稿可行,因为共享训练)、以及尺寸配比得当。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →