LLaDA2.2 把多轮 Agent 真正瓶颈指向解码速度

Direct_Band896 · reddit · 2026-07-25

多轮 Agent 的真正延迟税,可能是解码速度

这条讨论的核心观点是:在多轮 agent 里,最拖慢用户体验和推理成本的,往往不是工具调用次数或重试,而是模型逐 token 串行解码本身。一个任务里要经历规划、调用工具、读取结果、再生成的多个回合,decode 成了被反复叠加的“隐形税”。

LLaDA2.2 试图直接解决这个瓶颈

帖子提到 LLaDA2.2:一个面向多轮工具使用的 100B 级 MoE 扩散模型。它不是像自回归模型那样一字一字锁死输出,而是按块解码,并且可以在解码过程中保留、替换、删除、插入 token,等于允许模型回头修改自己刚写出来的内容。

帖子里给出的关键数据

但它不是“全能更强”

帖子也强调,LLaDA2.2 在 SWE bench 和一般知识任务上仍落后于那位自回归对手,所以它的卖点不是通用推理更强,而是更适合多轮工具链里的延迟与吞吐。另外,目前它还有明显落地限制:

一句话说,这条帖子的价值在于:如果你的 agent 系统最痛的是串行 decode,这种“按块重写”的模型路线就是正对症下药。

所属事件:inclusionAI 发布 LLaDA2.2-flash 扩散模型(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →