DiffusionGemma 技术报告:并行解码突破 LLM 推理速度瓶颈
bodonoghue85 · x · 2026-08-04
Google 团队发布了 DiffusionGemma 技术报告,这是一种基于离散扩散的实验性开源语言模型。与传统自回归模型逐个 token 解码不同,它通过并行迭代细化 256 个 token 的区块,极大提升了文本生成速度。
该模型基于拥有 3.8B 激活参数和 25.2B 总参数的混合专家模型 Gemma 4 微调而来。其两阶段计算高效训练流程,使用的训练 token 量不到原始 AR 模型总预算的 10%:第一阶段通过监督微调学习双向去噪,第二阶段结合强化学习与采样器蒸馏来提升生成质量。
所属事件:DeepMind发布DiffusionGemma:扩散模型实现极速文本生成(5 条相关)→
「模型」频道最新
- 抛弃 Claude Code:将深度研究工作流迁移至开源模型实战 — TheZachMueller · 2026-08-04
- 实测对比:MMH3 多模态能力优于 Google Omni Flash — Ok-Act-9620 · 2026-08-04
- 长上下文模型仍会遗忘:开发者分享长对话管理实践 — Entire-Ship8618 · 2026-08-04
- Kimi K3 投机解码模型下载破 60 万,AMD MI355X 实测吞吐大增 — bookwormengr · 2026-08-04
- Kimi K3 推理模式需保留完整消息,多数人用错了 — NielsRogge · 2026-08-04
- 让AI拿10万开一年网店,Qwen3.8-Max翻四倍赚41万 — APPSO · 2026-08-04