Uno 用 AR 架构无损并行采样,速度超 EAGLE-3 全部扩散 LLM
HongyiWang10 · x · 2026-09-05
IFM 团队发布 K2-Horizon-7B-Uno,针对扩散 LLM 相比 AR 模型的两大短板(质量更低、大批次推理更慢)提出统一架构方案:
- 保留 LLM 的 AR 架构,每层带两组权重:AR 权重 + 扩散权重
- 扩散权重(LoRA 适配器)可从 AR 分布无损并行采样
- 速度超过所有投机解码方法(DFlash、EAGLE-3),成绩击败 Mercury 2、Diffusion Gemma、Llada 等所有扩散 LLM
评测亮点:SWE-bench Verified 70.1(对比基线 0.8–18.7)、AIME-24 93.0、GPQA-Diamond 77.1、Terminal-Bench v2.1 39.1;平均 TPF 仅 2.71,系统吞吐 5,255。模型已在 Hugging Face 上以 Apache 2.0 开源(含 LoRA 适配器,底模单独托管)。
所属事件:Uno 混合架构让扩散LLM兼得质量与速度(4 条相关)→
「研究」频道最新
- brwilder:拟人化之外,把 LLM 当工程系统解释行为更有效 — brwilder · 2026-09-05
- Orbis 论文:将视频生成变为可持续运行的可控视觉过程 — rohanpaul_ai · 2026-09-05
- Anthropic 训练模型用数千条真实行为解释学会自我解释 — a_karvonen · 2026-09-05
- LLM 概率自相矛盾?AI×经济学的校准研究思路引关注 — soumitrashukla9 · 2026-09-05
- 前沿物理基准 CritPt 最佳模型仅约 30% 分数,远未饱和 — geoffwolfe · 2026-09-05
- Delaunay Canopy 入选 ECCV 2026:稀疏机载 LiDAR 重建建筑线框 — RexDouglass · 2026-09-05