扩散增强 LLM「Uno」:8B 跑赢 26B DiffusionGemma 与 Mercury 2
iScienceLuvr · x · 2026-09-04
一篇来自伊利诺伊、康奈尔、Cerebras 等机构(含 Eric Xing、Zhengzhong Liu 等)的新论文提出 diffusion-augmented LLM:
- 核心设计:模型有两组权重——标准 NTP 训练的 AR 权重负责质量,轻量扩散权重负责并行生成多个 token;
- Ψ-Spec 采样器:从 AR 分布并行采样 token,实现无损加速;
- 性能:8B 的 Uno 在所有评估 batch size 下吞吐都超过 DFlash、Eagle3 等 speculative decoding 方法,且无需额外 draft 模型,相对基线 AR 模型最高 3 倍加速;
- 评测:8B Uno 在 agentic 工具调用、编码、长上下文推理上全面胜过 26B 的开源 d-LLM DiffusionGemma 和商用 Mercury 2。
论文、代码与 HuggingFace 权重均已公开。
所属事件:Uno 架构发布:扩散增强 LLM 质量与速度兼得(2 条相关)→
「Infra」频道最新
- DeepSeek V4 Flash Vision 亮相,305B 权重本地部署门槛极高 — No_Issue_8224 · 2026-09-04
- Tim Sweeney:游戏业正遭遇 1980 年代以来最严重崩盘 — tekbog · 2026-09-04
- Transformers.js 播客预告:浏览器内跑抠图与转写 — nicodotdev · 2026-09-04
- Qwen3.8-Flash-Next 跑通 256K 上下文:DDR4+Tesla T4 实测 16 tok/s — BusTiny207 · 2026-09-04
- Nvidia 推 PAIR:把家庭网络变成本地 AI 迷你数据中心 — The Decoder · 2026-09-04
- 被 modder 破解倒逼,Nvidia 官宣 DLSS 5 将支持 RTX 40 系显卡 — tomwarren · 2026-09-04