vLLM 投机解码上线 AMD MI300X/MI355X,多 token 并行验证降延迟
petrusenko_max · x · 2026-09-07
vLLM 在 AMD MI300X 和 MI355X GPU 上支持投机解码(speculative decoding):一次验证多个候选 token,替代逐 token 的标准解码,从而降低延迟,同时保持输出行为不变。
「Infra」频道最新
- 韩国平均结婚成本 ≈ 一台 NVIDIA GB300 DGX Station,网友认真质疑婚姻必要性 — alvelda · 2026-09-07
- 16GB MacBook Air M5 跑 Agent:Qwen 9B 4bit 也难产完整应用 — Fluid-Author-9566 · 2026-09-07
- Gary Marcus 质疑 Astra 10 亿美元训练算力账单:scaling 数据已不透明 — GaryMarcus · 2026-09-07
- 算力新贵标准:按节点数算 GPU 才算「GPU 富人」 — capetorch · 2026-09-07
- 开源权重 vs 前沿 API:几百美元微调后每 token 成本骤降 — spilldahill · 2026-09-07
- M3 Max 上实测 Qwen 3.8 27B 与 Qwen Flash Next:体感几乎一致 — Zeeplankton · 2026-09-07