专题 · FULL STORY

谷歌发布DiffusionGemma探索文本扩散模型

谷歌DeepMind近期发布DiffusionGemma技术报告,采用并行扩散解码打破传统自回归速度瓶颈。社区随后深入解析了其在吞吐量与非因果纠错上的优势。

2026-08-04 ~ 2026-08-11 · 3 集 · 12 条

第 1 集 · DiffusionGemma发布:并行扩散解码突破LLM推理速度瓶颈(2026-08-04,8 条)

Google DeepMind 发布了实验性开放权重语言模型 DiffusionGemma 的技术报告。该模型采用离散扩散技术,打破传统自回归模型逐个 token 解码的范式,能够并行迭代细化 256 个 token 的区块,在单卡上实现每秒 1500 tokens 的生成速度。这为突破 LLM 推理速度瓶颈提供了一种全新的并行解码思路。

已确认

  • 核心机制与参数:DiffusionGemma 基于 Gemma 4(总参数量 25.2B,激活参数 3.8B)改造,采用离散扩散技术,通过双向注意力和迭代细化机制,实现 256 个 tokens 的并行输出。
  • 在线后训练:团队在监督微调(SFT)之后,联合使用了采样器蒸馏与强化学习。这一在线后训练机制成功将模型的质量与推理速度推向了新的帕累托前沿。
  • 性能优势:据作者 @bodonoghue85 分析,该架构不仅实现了单卡 1500 tokens/秒的极速生成,其优势还不仅限于单批量场景。在中低批量大小下,其延迟和吞吐量均展现出显著优势,且上下文越长性能收益越大。
  • 场景应用:在输入强约束的场景下(例如代码编辑,输出与输入高度相似),该模型相比自回归模型具有显著优势。

为什么重要

  • 这份长达 55 页的技术报告详细探索了扩散模型在语言生成领域的应用。其并行解码思路在需要高度受限或结构化输出的任务中展现出巨大潜力,有望大幅提升大模型在实际工程中的推理效率。

第 2 集 · 文本扩散模型优势解析:非因果纠错与吞吐量双优(2026-08-04,2 条)

近期讨论深入解析了文本扩散模型相比传统自回归模型的显著优势。一方面,扩散模型利用双向注意力与迭代精修机制,允许在生成的 token 画布内进行推理,从而实现自回归模型无法做到的非因果纠错。另一方面,其优势不仅限于单批量场景,在中小批量处理中同样具备显著的延迟和吞吐量优势,且这些性能收益会随着上下文长度的增加而进一步扩大。

第 3 集 · Google发布DiffusionGemma技术报告探索文本扩散(2026-08-11,2 条)

Google 官方近期发布了 DiffusionGemma 的完整技术报告,详细分享了团队在文本扩散模型领域的核心见解与研究过程,旨在推动开源社区共同探索全新的文本生成范式。与此同时,llama.cpp 社区也已提交了针对该模型的适配 PR,积极推进其在本地推理生态中的落地应用。