inclusionAI 发布 LLaDA2.2-flash:100B 扩散模型专攻 Agent 提速
inclusionAI 发布了 LLaDA2.2-flash,这是一款面向 agent 场景的 100B MoE 扩散式语言模型。该模型原生支持 128K 上下文,旨在通过并行解码技术提升多轮工具调用与长上下文交互的效率,为解决大模型智能体延迟问题提供了新思路。
已确认
模型参数规模为 100B MoE,原生支持 128K 上下文窗口。其核心机制是采用 Levenshtein editing(包含 KEEP、SUBSTITUTION、DELETE 和 INSERT 操作)来实现平行解码。在具体的 agent 评测方面,据 @FellMentKE 与 @qruiq 总结,该模型在 BFCL 和 SWE-bench 中给出了高吞吐成绩,且推理速度最高可达传统自回归模型的 2.3 倍。@heyshrutimishra 也指出该模型在智能体工作负载中能带来约 1.6 倍的整体提速。
尚未确认
扩散模型在综合能力上的表现依然存在局限。@Additional-Engine402 通过同规模对比评测指出,LLaDA2.2 在通用知识和多数代码评测上整体落后于自回归模型,目前仅在少数 agent 场景中具备速度优势。
为什么重要
扩散式 LLM 正在向复杂的智能体应用拓展。@DirectBand896 指出,在多轮 agent 任务中,真正拖慢响应并推高推理成本的瓶颈往往不是工具调用次数,而是模型逐 token 串行解码本身。LLaDA2.2-flash 通过引入编辑式扩散与并行解码,直击这一延迟痛点,为高吞吐、长上下文的 Agent 推理提供了新的解题思路。
2026-07-23 ~ 2026-07-25 · 9 条相关
一手来源
- LLaDA2.2-flash 把 128K 上下文和编辑式扩散带进 agent 模型 — pmttyji ·
- Inclusion AI 推出面向智能体的扩散语言模型 LLaDA2.2-flash — heyshrutimishra ·
- 同规模对比评测显示:扩散模型整体落后,但在智能体循环更快 — Additional-Engine402 ·
- 【源头】LLaDA2.2-flash 把 128K 上下文和编辑式扩散带进 agent 模型 — pmttyji · 2026-07-23
- LLaDA2.2-flash 发布:100B MoE 扩散模型,支持 128K 上下文 — QuixiAI · 2026-07-24
- LLaDA 2.2 在 BFCL 和 SWE-bench 上给出高吞吐成绩 — FellMentKE · 2026-07-24
- LLaDA2.2 100B 扩散 LLM 在 agent 评测上追平 AR 模型 — qruiq · 2026-07-25
- LLaDA2.2 把多轮 Agent 真正瓶颈指向解码速度 — Direct_Band896 · 2026-07-25
- 【源头】同规模对比评测显示:扩散模型整体落后,但在智能体循环更快 — Additional-Engine402 · 2026-07-25
- Inclusion AI 发布 LLaDA2.2-flash,面向 Agent 提速 1.6 倍 — heyshrutimishra · 2026-07-25
- LLaDA2.2 把扩散大模型推向智能体任务,支持 128K 上下文自我编辑 — alifcoder · 2026-07-25
- 【源头】Inclusion AI 推出面向智能体的扩散语言模型 LLaDA2.2-flash — heyshrutimishra · 2026-07-25