单卡 1500 tokens/秒:DiffusionGemma 技术报告发布
kastnerkyle · x · 2026-08-06
DiffusionGemma 团队发布了实验性开源权重语言模型技术报告。该模型基于 Gemma 4(总参数量 25.2B,激活参数 3.8B),将其改造为离散扩散模型,打破了传统自回归(AR)模型逐字解码的瓶颈。
核心机制与性能
- 并行生成:模型通过迭代并行细化 256 个 tokens 的区块,平均每次前向传播可生成约 20 个 tokens。
- 极速推理:在单张 NVIDIA H100 GPU 上实现了约 1500 tokens/秒的生成速度,显著快于现有的自回归模型及投机解码技术。
训练策略
该研究并未从零开始训练,而是采用计算高效的两阶段微调流程,使用的 token 预算不到原始 AR 模型总训练量的 10%:
- 监督微调(SFT):教会模型双向去噪。
- 强化学习与采样器蒸馏:联合提升生成质量与推理效率。
此外,模型保留了原模型的多模态输入、长上下文支持及思考模式,且仍具备 AR 生成能力(仅有轻微性能下降),为未来的混合扩散-AR 解码铺平了道路。
所属事件:DeepMind发布DiffusionGemma:离散扩散实现极速并行解码(8 条相关)→
「模型」频道最新
- 预测市场看好Anthropic:2026年AI霸主概率达69% — Polymarket · 2026-08-06
- DeepSeek 试错加 Opus 兜底:开发者分享 AI 编程模型组合技 — gandamu_ml · 2026-08-06
- Palantir 实测:NVIDIA 原版模型 24 小时即超越前沿大模型 — eliano · 2026-08-06
- 传谷歌 Gemini 3.5 Pro 已部署完毕,最快今日发布 — Rare_Bunch4348 · 2026-08-06
- 开发者痛批谷歌AI掉队:自2017年Transformer后无突破 — MarcJSchmidt · 2026-08-06
- 实测 Qwen3.8-Max 多模态能力:精准提取图像边界框 — lateinteraction · 2026-08-06