DiffusionGemma 技术报告:并行解码突破 LLM 推理速度瓶颈

bodonoghue85 · x · 2026-08-04

Google 团队发布了 DiffusionGemma 技术报告,这是一种基于离散扩散的实验性开源语言模型。与传统自回归模型逐个 token 解码不同,它通过并行迭代细化 256 个 token 的区块,极大提升了文本生成速度。

该模型基于拥有 3.8B 激活参数和 25.2B 总参数的混合专家模型 Gemma 4 微调而来。其两阶段计算高效训练流程,使用的训练 token 量不到原始 AR 模型总预算的 10%:第一阶段通过监督微调学习双向去噪,第二阶段结合强化学习与采样器蒸馏来提升生成质量。

所属事件:DeepMind发布DiffusionGemma:扩散模型实现极速文本生成(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →