LLaDA2.2 让扩散语言模型首次进入长程 Agent 任务
量子位 · wechat · 2026-07-28
LLaDA2.2 把扩散语言模型推进长程 Agent 任务
蚂蚁旗下 inclusionAI 团队发布 LLaDA2.2,这是一款原生支持 128K 上下文 的 千亿级 MoE 扩散语言模型。团队称,它是首个进入长程智能体任务的大规模 agentic diffusion model。
这次升级的核心包括:
- Levenshtein 编辑:在扩散解码中加入 KEEP / SUBSTITUTE / DELETE / INSERT 四种原子操作,让模型能在生成过程中自我增删改
- L-EBPO:把多轮交互中的编辑决策建模为强化学习问题,利用环境反馈来决定何时修正
- BlockRouting:在 MoE 推理里先按 block 选专家池,再做 token 级路由,降低 HBM 流量和通信开销
效果上,SWE-bench Verified 仅开启 Levenshtein 编辑就把分数从 35.8 提升到 44.4。在 7 个 Agent 基准上,LLaDA2.2-flash 的平均表现接近 Ling-2.6-flash,并在 τ²-Bench、PinchBench、MCP-Atlas 上实现反超;同时它宣称在 11 类工作负载上的平均 BF16 吞吐量达到对手的 1.64 倍,FP8 下还能再提升 18.6%。
所属事件:蚂蚁 LLaDA2.2 扩散语言模型进军长程 Agent(2 条相关)→
「模型」频道最新
- Anthropic 的 Opus 4.8 非代码任务更强,但 5 代刷榜更好 — burkov · 2026-07-28
- Moonshot 发布 Kimi K3:2.8T MoE 和 100 万上下文 — burny_tech · 2026-07-28
- Thinking Machines 发布 9750 亿参数开源多模态模型 Inkling — paraschopra · 2026-07-28
- 多人被 Opus 5 的首轮演示误导,反复任务才见真实水平 — Rasmic · 2026-07-28
- 用户称 GPT-5.4、Opus 4.6 和 Kimi k3 已够用 — haider1 · 2026-07-28
- Opus 5 基准测试近乎完美,真实体验却很不稳定 — yunta_tsai · 2026-07-28