DeepMind 发布 DiffusionGemma:扩散模型实现极速文本生成
deepmind · hf · 2026-08-04
Google DeepMind 发布了 DiffusionGemma 技术报告,这是一款实验性的开放权重语言模型。与传统的自回归(AR)模型逐字解码不同,它采用离散扩散技术,能够并行迭代细化 256 个 token 的区块,从而打破顺序解码的瓶颈。
核心亮点:
- 高效训练:基于 Gemma 4 模型(总参数量 25.2B,激活参数 3.8B)微调,两阶段训练使用的 token 量不到原 AR 模型预算的 10%。
- 极速推理:在单张 NVIDIA H100 GPU 上,每次前向传递可生成约 20 个 token,实现每秒约 1,500 个 token 的生成速度,即使配合最先进的投机解码,也远快于传统 AR 模型。
- 能力保留:不仅保留了思维链模式、多模态输入和长上下文支持,在经过扩散微调后,依然具备 AR 生成能力,为未来的混合解码铺平了道路。
「模型」频道最新
- 分析 Kimi-K3 开源:权重不再是壁垒,数据飞轮才是 — karminski3 · 2026-08-04
- 中美大模型价格战:美国前沿大厂突然大谈「效率」 — deliprao · 2026-08-04
- Qwen 3.8 编码实测:性能逼近 K3 且价格仅一半 — bindureddy · 2026-08-04
- Fable 与 Gemini 视觉模型被地名误导,地理识别翻车 — HanchungLee · 2026-08-04
- 观点:掩码语言建模是历史弯路,本可直奔自回归 — jxmnop · 2026-08-04
- 腾讯押注 2950 亿参数 MoE 模型 Hy3,主打智能体能力 — emmanuelvivier · 2026-08-04