蚂蚁开源扩散大模型 LLaDA 2.2,主打智能体与自纠错

蚂蚁集团 inclusionAI 团队发布了面向智能体任务的大规模扩散语言模型 LLaDA 2.2,并已完全开源模型权重与代码。官方将其定位为首个真正能胜任智能体工作的扩散大模型,能够进行规划与工具调用。该模型打破了传统自回归模型从左向右生成的限制,实现了边生成边纠错。

已确认

性能与速度:LLaDA 2.2-flash 支持原生 128K 上下文(采用从 8K 逐步扩展的训练策略)。吞吐量平均达到 Ling-2.6-flash 的 1.64 倍,若结合 FP8 量化还能额外提升 18.6%。

基准测试:在多项基准测试中,LLaDA 2.2-flash 超越了 Ling-2.6-flash。例如在 SWE-bench Verified 上得分为 49.28(对比 31.88);在 τ²-Bench 上取得 592.80(对比 334.90),其 fast mode 更是达到 705.30。此外在 SWE-bench Pro 和 SWE-bench Multilingual 等测试中也保持领先。

自纠错与训练机制:模型在生成过程中可执行自我修正,发现错误并删除修复,同时保持块级并行的速度。其底层机制基于 Levenshtein editing,允许模型对输出执行 KEEP、SUBSTITUTE、DELETE、INSERT 四种原语操作。训练流程包含三阶段:带 Levenshtein editing 的预训练、长上下文与智能体数据的 SFT,以及使用 L-EBPO(阻断长任务错误传播)的强化学习阶段。

为什么重要

传统自回归大模型只能从左向右生成,难以在发现错误后进行回溯修正。LLaDA 2.2 通过引入扩散模型架构和块级编辑机制,打破了这一限制,实现了生成过程中的动态纠错。这不仅在工程上大幅提升了推理吞吐量,更在需要长轨迹规划与工具调用的复杂智能体任务(如代码修复和多语言软件工程)中展现出显著优势,为非自回归 LLM 的实际落地提供了重要参考。

2026-07-25 ~ 2026-07-26 · 10 条相关

事件全程(共 2 集)→

一手来源