本地推理慢?推测解码用小模型起草、大模型批量验证
HowDevelop · x · 2026-09-17
本地推理解决了隐私与成本问题,但每个 token 都要完整跑一遍大模型前向传播,长文本和复杂推理场景下速度瓶颈明显。
推测解码改变了这笔账:由一个更小更快的草稿模型提前提出 4-8 个 token,大模型(目标模型)一次批量前向验证,只接受它本来也会生成的 token——结果是用约一次前向的代价换来多个 token,质量完全一致但输出更快。
但有前提:不是任意两个模型组合都能加速,必须满足三点——共享 tokenizer(硬性要求,不同 tokenizer 会彻底破坏流程)、同模型家族(如 Qwen3-30B 目标 + Qwen3-0.6B 草稿可行,因为共享训练)、以及尺寸配比得当。
「Infra」频道最新
- OpenAI 将 Astra 迁至 Vera Rubin,72 小时再获 2 倍吞吐提升 — MickeySteamboat · 2026-09-17
- Baseten 推出 Hosted Tools:开源模型推理路径内直接联网搜索 — baseten · 2026-09-17
- 两张 5060 Ti 能不能训视频 LoRA?消费级多卡训练可行性讨论 — Inner_Employment_332 · 2026-09-17
- 15 个小模型各有一绝:7B 级也能打赢百倍大的模型 — bigaiguy · 2026-09-17
- 印度拟投约 300 亿美元建设本土半导体产业 — Polymarket · 2026-09-17
- 受 AgentConf 演讲启发,开发者计划在家用 Blackwell GPU 本地跑 Agent — TejasKumar_ · 2026-09-17