投机解码框架 Uno 获推理厂商采用:28k 长上下文提速至 DFlash 两倍
yuntiandeng · x · 2026-10-02
扩散增强 LLM 论文(arXiv:2609.04010,作者含 Eric Xing 等)提出的投机解码框架 Uno 正被多家推理服务商关注,broadnet 已上线使用。实测:Gemma 4 26B 在单张 RTX 3090、28k token 长提示下,DFlash 仅 0.66x(比不投机还慢),Uno 达 1.30x 无损加速,约为 DFlash 两倍,在 2k-28k 各长度均快于普通自回归。其 drafter 仅用 1 万条开源 prompt、单 GPU 训练而成;Uno 已可在 vLLM 中运行,长上下文构建与新 drafter 将随下个版本发布。
「Infra」频道最新
- 180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5% — TheZachMueller · 2026-10-02
- Google 称太空数据中心需 Starship 发射 1600 次才能落地 — TechCrunch AI · 2026-10-02
- 开源本地 AI 数字人应用:LM Studio 加 Chatterbox 克隆语音 — TheRedHairedHero · 2026-10-02
- 大科技 Capex 已占华尔街利润增长的一半 — speckx · 2026-10-02
- Quail 团队用 roofline 模型估算 AI-SQL 延迟:5k 条评论过滤下限仅 6.6 秒 — sh_reya · 2026-10-02
- Modal Runtime 大会上 Einar 当场启动百万个 sandbox — graceisford · 2026-10-02