投机解码框架 Uno 获推理厂商采用:28k 长上下文提速至 DFlash 两倍

yuntiandeng · x · 2026-10-02

扩散增强 LLM 论文(arXiv:2609.04010,作者含 Eric Xing 等)提出的投机解码框架 Uno 正被多家推理服务商关注,broadnet 已上线使用。实测:Gemma 4 26B 在单张 RTX 3090、28k token 长提示下,DFlash 仅 0.66x(比不投机还慢),Uno 达 1.30x 无损加速,约为 DFlash 两倍,在 2k-28k 各长度均快于普通自回归。其 drafter 仅用 1 万条开源 prompt、单 GPU 训练而成;Uno 已可在 vLLM 中运行,长上下文构建与新 drafter 将随下个版本发布。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →