LLaDA2.2 把多轮 Agent 真正瓶颈指向解码速度
Direct_Band896 · reddit · 2026-07-25
多轮 Agent 的真正延迟税,可能是解码速度
这条讨论的核心观点是:在多轮 agent 里,最拖慢用户体验和推理成本的,往往不是工具调用次数或重试,而是模型逐 token 串行解码本身。一个任务里要经历规划、调用工具、读取结果、再生成的多个回合,decode 成了被反复叠加的“隐形税”。
LLaDA2.2 试图直接解决这个瓶颈
帖子提到 LLaDA2.2:一个面向多轮工具使用的 100B 级 MoE 扩散模型。它不是像自回归模型那样一字一字锁死输出,而是按块解码,并且可以在解码过程中保留、替换、删除、插入 token,等于允许模型回头修改自己刚写出来的内容。
帖子里给出的关键数据
- 相比自回归兄弟模型,平均解码吞吐约 1.6x
- 在 agent 工作负载上提升接近 2.3x
- 在 BFCL function calling 集上约 703 tokens/s
- 交互式 agent 评测也更好:
- tau2 bench:80.33 vs 76.36
- MCP Atlas:46.21 vs 41.12
但它不是“全能更强”
帖子也强调,LLaDA2.2 在 SWE bench 和一般知识任务上仍落后于那位自回归对手,所以它的卖点不是通用推理更强,而是更适合多轮工具链里的延迟与吞吐。另外,目前它还有明显落地限制:
- 权重体积约 205.8 GB
- 许可证是 Apache 2.0
- 目前没有 llama.cpp 路径
- SGLang 支持也只是“即将支持”
一句话说,这条帖子的价值在于:如果你的 agent 系统最痛的是串行 decode,这种“按块重写”的模型路线就是正对症下药。
所属事件:inclusionAI 发布 LLaDA2.2-flash:100B 扩散模型专攻 Agent 提速(9 条相关)→
「编程与Agent」频道最新
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11