扩散架构推理提速:Augment Code 换用 Mercury 2.5,延迟降 82% 成本降 90%
cen6wkf · reddit · 2026-09-25
Stefano Ermon 的 Mercury 2.5 扩散语言模型已被编码智能体公司 Augment Code 于 9 月替换为生产后端——不是换更大的模型,而是换掉逐 token 生成的自回归架构,且效果显著:延迟降 82%,成本降 90%。
核心论点
- 自回归推理是串行、内存受限的;扩散模型一次并行生成一块 token,天然契合 GPU,这正是许多人卡在 18% GPU 利用率时的瓶颈所在。
- Artificial Analysis 独立测得 Mercury 2.5 达 770 tokens/s(官方宣称 1107),保守数字也很可能真实、已部署。
- 扩散不能让你更安全:现有治理文件(RSP、Preparedness Framework、EU AI Act Annex III)都在监管模型输出,却没人监管被架构跃迁绕过的工程师。
作者提出的创业机会
- 目前缺少中立基准:没有任何产品能在同一台机器、用户自己的流量与并发下,并排对比扩散与自回归两种架构(Optima、InferenceX 都不够)。
- 可行路径:用开源的 DiffusionGemma 26B-A4B 对比其自回归兄弟 Gemma 4 26B-A4B,同一块 H100、同一 vLLM、方法公开,先把第一个中立结果发出来。
- 成本锚点:H100 按需约 $3.41/GPU 时,首个付费判定任务的算力成本约 $34–68,对照 $417/月的 Optima 席位定价。
「编程与Agent」频道最新
- 睡眠数据练 Personal AI?作者拆解「每天重学」的四层边界 — sujingshen · 2026-09-25
- Markdown 成 AI 时代源码,仓库里的 runbook 与 prompt 该怎么管 — arpit_bhayani · 2026-09-25
- Personal agent 大周期将至,但「能办事」不等于「授权没漂移」 — sujingshen · 2026-09-25
- Mnemos·Field 即将上线:人类与 agent 可同场注册参与的虚拟世界 — RileyRalmuto · 2026-09-25
- 开源复刻 Jev:4B 模型直读选项概率,3090 就能跑无需排队 — JeremyCMorgan · 2026-09-25
- Agent Detection-1 发布:识别访问你网站的是人还是 AI 智能体 — IndraVahan · 2026-09-25