分离式量化:Prefill 与 Decode 各用最优格式,1-bit 精度涨 32 分
ISTA-DASLab · hf · 2026-09-29
ISTA-DASLab 提出「分离式量化」(Disaggregated Quantization, DQ):LLM 推理的 prefill 与 decode 两个阶段收益点不同——低精度算术加速 prompt 处理,紧凑权重减少生成时的内存流量——于是为两阶段分别专门设计计算格式、权重与存储布局。
关键结果:
- 在 Qwen 3 和 Gemma 3 上,仅去掉 decode 阶段的激活量化即可提升 decode 密集任务精度,且不增加推理成本
- 单独训练计算原生的 prefill 权重,配合 2-3-bit decode,在 prefill 与 decode 密集任务上均持平或超过 weight-only 推理
- 基于已发布的 Qwen3.8-27B GGUF 解码器训练 NVFP4 prefiller,1-bit 精度在 MMLU-Pro 提升 32.5 分、MMMU-Pro 提升 35.3 分,且不改 decode checkpoint
- 为在单卡装下额外 checkpoint,提出 offloaded disaggregated prefill(ODP),从 SSD 流式加载权重并在 prompt 长度上摊销;27B 模型在 8K prompt 下 llama.cpp 首 token 时间加速 1.78 倍
- 在 vLLM 中评估分离式服务精度,并通过后训练量化在最高 2.8T 参数模型上验证共享权重格式分离
「Infra」频道最新
- 谷歌趋势美国区榜首全是怀俄明州?作者疑因数据中心机器流量 — lilyraynyc · 2026-09-29
- Sentdex:本地跑了 40 亿 token,GLM 5.3 Flash 成其最常用本地模型 — Sentdex · 2026-09-29
- kipply 推出推理成本算术教程,拆解 H200/B200 上的 prefill 与 decode 开销 — ycombinator · 2026-09-29
- 开发者实测「让 GPU 别那么热」:Astra 疑似能降温降耗 — TheZachMueller · 2026-09-29
- P40 上跑 Qwen 3.6 35B IQ4 量化,实测 37-83 tok/s 并不更慢 — otacon6531 · 2026-09-29
- Macrocosmos 发布 iota SDK 与 Liquid Compute,把散落算力聚合成训练集群 — markjeffrey · 2026-09-29