UCLA 提出自推测解码 SSR,加速推理模型
kastnerkyle · x · 2026-08-25
UCLA 研究团队提出 SSR(Self-Speculation for Reasoning Models),一种无需训练的自推测解码方法,旨在加速长链式思考(CoT)推理模型。该方法利用部分 CoT 的回答分布作为草稿,完整 CoT 分布作为验证者,基于两者语义和词汇的重叠度一次性接受长草稿前缀。SSR 还引入后缀解码技术,利用草稿填充后缀缓存,进一步减少延迟。实验表明,该方法在结构化和长文本生成任务上显著降低了推理延迟。
「Infra」频道最新
- AI 驱动美国电网与蓝领就业二十年来首度扩张 — danielrock · 2026-08-25
- Relace 优化推理成本,Deepseek v4 降价近半 — stuffyokodraws · 2026-08-25
- h3.c 新分支:支持 GGUF、多 GPU 与 UI — QuixiAI · 2026-08-25
- Garry Tan:社区抵制数据中心,一年毁掉万亿美元 AI 基建 — garrytan · 2026-08-25
- 用 Mac 塞满服务器机架:Namespace Labs 展示规模化部署 — zacharynado · 2026-08-25
- AMD Helios 机架功耗媲美 Vera Rubin — BenBajarin · 2026-08-25