LLaDA2.2 让扩散语言模型首次进入长程 Agent 任务
量子位 · wechat · 2026-07-28
LLaDA2.2 把扩散语言模型推进长程 Agent 任务
蚂蚁旗下 inclusionAI 团队发布 LLaDA2.2,这是一款原生支持 128K 上下文 的 千亿级 MoE 扩散语言模型。团队称,它是首个进入长程智能体任务的大规模 agentic diffusion model。
这次升级的核心包括:
- Levenshtein 编辑:在扩散解码中加入 KEEP / SUBSTITUTE / DELETE / INSERT 四种原子操作,让模型能在生成过程中自我增删改
- L-EBPO:把多轮交互中的编辑决策建模为强化学习问题,利用环境反馈来决定何时修正
- BlockRouting:在 MoE 推理里先按 block 选专家池,再做 token 级路由,降低 HBM 流量和通信开销
效果上,SWE-bench Verified 仅开启 Levenshtein 编辑就把分数从 35.8 提升到 44.4。在 7 个 Agent 基准上,LLaDA2.2-flash 的平均表现接近 Ling-2.6-flash,并在 τ²-Bench、PinchBench、MCP-Atlas 上实现反超;同时它宣称在 11 类工作负载上的平均 BF16 吞吐量达到对手的 1.64 倍,FP8 下还能再提升 18.6%。
所属事件:蚂蚁 LLaDA2.2 扩散语言模型进军长程 Agent(2 条相关)→
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11