论文提出 HedgeSpec:突破投机解码草稿模型选择瓶颈
D3VAUX · x · 2026-07-31
Rice 大学与 AWS 团队联合发表论文 Not-a-Bandit,针对大模型推理加速中的「在线草稿模型选择」问题提出了新算法 HedgeSpec。
核心内容:
- 无需额外查询即可评估: 算法能在不增加对目标模型额外查询的情况下,准确评估所有候选草稿模型,从而在单次查询中与事后最优的草稿模型表现看齐。
- 指数级提升: 随着草稿模型数量增加,该方法相比现有的基于 Bandit 的策略实现了指数级的性能改善。
- 广泛适用性: 适用于单草稿、多草稿及草稿树等任何投机解码方法,且具备系统高效版本,大幅降低计算与延迟开销。
- 实验结果: 在开源大模型上的广泛实验证明,当存在特定领域的专家草稿模型时(尤其是需要长推理链的场景),HedgeSpec 大幅超越了当前最先进的 EAGLE3 和 BanditSpec 基线。
「Infra」频道最新
- GPU云Nscale斥资16.5亿美元收购Anyscale,发力分布式计算 — kevinsxu · 2026-07-31
- 曝 OpenAI 模型将登陆 Cerebras:750 tokens/s 极速推理 — kimmonismus · 2026-07-31
- AI基础设施需求强劲:数据中心订单激增,供应链压力显现 — a16z Newsletter · 2026-07-31
- NVIDIA 教程:将 Polars 数据处理代码跑在 GPU 上 — NVIDIAAI · 2026-07-31
- AI成本暴跌:智能即服务的论点或被颠覆 — yacineMTB · 2026-07-31
- 专家讨论:小规模实验可行,但公开训练千亿参数模型不现实 — zephyr_z9 · 2026-07-31