Uno 用扩散并行起草提速 Qwen3-8B,单请求吞吐提升 2.5 倍
rohanpaul_ai · x · 2026-09-09
Uno 提出一种不改变输出分布即可加速现有 LLM 的方法:保留原自回归模型负责质量,只用轻量 diffusion adapter 并行起草多个 token,再由原模型验证,因此无需单独的 draft 模型,也保持基础模型的采样行为。
在 Qwen3-8B 上,Uno 在最大测试 batch size 下实现单请求吞吐提升 2.5 倍、系统吞吐提升 1.6 倍,端到端 RL 训练最高提速 40%。
所属事件:Uno 用离散扩散为 LLM 实现无损推理加速(3 条相关)→
「Infra」频道最新
- 一周烧掉 2250 万美元算力,数学突破有了新价格标签 — vykthur · 2026-09-09
- 100 万美元听着多,只够 OpenAI 算力开销 10.5 分钟 — wordgrammer · 2026-09-09
- SageMaker Feature Store 推出 UpdateRecord,单次调用实现特征级写入 — AWS ML Blog · 2026-09-09
- Modular 统一计算层演示:TPU v6e、d-Matrix 数天内完成接入 — carrycooldude · 2026-09-09
- LM Studio 发布 Bionic 1.1.2:会话加载更快,无障碍支持大升级 — mattturck · 2026-09-09
- 算账:复现 Navier-Stokes 证明需 3000 亿 token,个人成本上千万美元 — soumitrashukla9 · 2026-09-09