inclusionAI 发布 LLaDA2.2-flash:100B 扩散模型专攻 Agent 提速

inclusionAI 发布了 LLaDA2.2-flash,这是一款面向 agent 场景的 100B MoE 扩散式语言模型。该模型原生支持 128K 上下文,旨在通过并行解码技术提升多轮工具调用与长上下文交互的效率,为解决大模型智能体延迟问题提供了新思路。

已确认

模型参数规模为 100B MoE,原生支持 128K 上下文窗口。其核心机制是采用 Levenshtein editing(包含 KEEP、SUBSTITUTION、DELETE 和 INSERT 操作)来实现平行解码。在具体的 agent 评测方面,据 @FellMentKE 与 @qruiq 总结,该模型在 BFCL 和 SWE-bench 中给出了高吞吐成绩,且推理速度最高可达传统自回归模型的 2.3 倍。@heyshrutimishra 也指出该模型在智能体工作负载中能带来约 1.6 倍的整体提速。

尚未确认

扩散模型在综合能力上的表现依然存在局限。@Additional-Engine402 通过同规模对比评测指出,LLaDA2.2 在通用知识和多数代码评测上整体落后于自回归模型,目前仅在少数 agent 场景中具备速度优势。

为什么重要

扩散式 LLM 正在向复杂的智能体应用拓展。@DirectBand896 指出,在多轮 agent 任务中,真正拖慢响应并推高推理成本的瓶颈往往不是工具调用次数,而是模型逐 token 串行解码本身。LLaDA2.2-flash 通过引入编辑式扩散与并行解码,直击这一延迟痛点,为高吞吐、长上下文的 Agent 推理提供了新的解题思路。

2026-07-23 ~ 2026-07-25 · 9 条相关

一手来源