SpecQuant 论文:免训练推理加速 35-43%,精度损失不足 2%

saurabhtwq · x · 2026-09-21

论文 SpecQuant 登上 arXiv,提出一个免训练的本地推理加速框架:从同一基座模型派生多个量化变体(INT4/FP8/FP16),共享权重保证投机解码的 token 接受率,同时按查询预测复杂度动态路由——简单事实任务走轻量量化变体,复杂推理或长上下文走全精度。在基于 Qwen2.5 的模型上于 MMLU、AlpacaEval、GSM8K 评测中实现 35-43% 加速,精度损失不超过 2%,无需重训或单独 draft 模型,面向消费级硬件的端侧部署。作者注:实验约一年前完成,部分设置已略显过时。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →