LLaDA2.2 把多轮 Agent 真正瓶颈指向解码速度
Direct_Band896 · reddit · 2026-07-25
多轮 Agent 的真正延迟税,可能是解码速度
这条讨论的核心观点是:在多轮 agent 里,最拖慢用户体验和推理成本的,往往不是工具调用次数或重试,而是模型逐 token 串行解码本身。一个任务里要经历规划、调用工具、读取结果、再生成的多个回合,decode 成了被反复叠加的“隐形税”。
LLaDA2.2 试图直接解决这个瓶颈
帖子提到 LLaDA2.2:一个面向多轮工具使用的 100B 级 MoE 扩散模型。它不是像自回归模型那样一字一字锁死输出,而是按块解码,并且可以在解码过程中保留、替换、删除、插入 token,等于允许模型回头修改自己刚写出来的内容。
帖子里给出的关键数据
- 相比自回归兄弟模型,平均解码吞吐约 1.6x
- 在 agent 工作负载上提升接近 2.3x
- 在 BFCL function calling 集上约 703 tokens/s
- 交互式 agent 评测也更好:
- tau2 bench:80.33 vs 76.36
- MCP Atlas:46.21 vs 41.12
但它不是“全能更强”
帖子也强调,LLaDA2.2 在 SWE bench 和一般知识任务上仍落后于那位自回归对手,所以它的卖点不是通用推理更强,而是更适合多轮工具链里的延迟与吞吐。另外,目前它还有明显落地限制:
- 权重体积约 205.8 GB
- 许可证是 Apache 2.0
- 目前没有 llama.cpp 路径
- SGLang 支持也只是“即将支持”
一句话说,这条帖子的价值在于:如果你的 agent 系统最痛的是串行 decode,这种“按块重写”的模型路线就是正对症下药。
所属事件:inclusionAI 发布 LLaDA2.2-flash 扩散模型(5 条相关)→
「编程与Agent」频道最新
- GitHub Copilot 应用里已经能试 Claude Opus 5 — DanWahlin · 2026-07-25
- Codex 加入 Appshots 和后台电脑操作能力 — jxnlco · 2026-07-25
- 不只是写代码:AI 智能体的日常实用场景清单 — vboykis · 2026-07-25
- CLI 比设计糟糕的 MCP 更能让模型掌控上下文 — jobergum · 2026-07-25
- 创业者称 Codex 在 AI 运营中枢里总漏读 Markdown 上下文 — No-Bus2109 · 2026-07-25
- Codex 通过 oracle 工具构建 ChatGPT Pro 访问技能 — steipete · 2026-07-25