SpecQuant 论文:免训练推理加速 35-43%,精度损失不足 2%
saurabhtwq · x · 2026-09-21
论文 SpecQuant 登上 arXiv,提出一个免训练的本地推理加速框架:从同一基座模型派生多个量化变体(INT4/FP8/FP16),共享权重保证投机解码的 token 接受率,同时按查询预测复杂度动态路由——简单事实任务走轻量量化变体,复杂推理或长上下文走全精度。在基于 Qwen2.5 的模型上于 MMLU、AlpacaEval、GSM8K 评测中实现 35-43% 加速,精度损失不超过 2%,无需重训或单独 draft 模型,面向消费级硬件的端侧部署。作者注:实验约一年前完成,部分设置已略显过时。
「Infra」频道最新
- 为 Jane Street 建的数据中心发债遇冷,收益率升至约 11.3% — GaryMarcus · 2026-09-21
- 开发者安利 autonomous labs:本地 AI 玩家的 4GPU 机箱之选 — dee_hw · 2026-09-21
- CXMT 量产 11.95nm 第五代 DRAM,单片晶圆产出提升 50% — mark_k · 2026-09-21
- 开发者炮轰云厂商API无硬性消费上限:预算告警只是事后诸葛 — MaverikSh · 2026-09-21
- 华为 keynote 疑蹭 DeepSeek,实际分配算力或仅腾讯的零头 — teortaxesTex · 2026-09-21
- 自研 CUDA 兼容层让 Mac 跑图反超 RTX 5090,最快快 61% — LioDavinchy · 2026-09-21