LLaDA 2.2 把扩散模型推向真实智能体任务
omarsar0 · x · 2026-07-26
LLaDA 2.2 是一个面向 agent 的大规模 diffusion LLM,主打并行解码速度和长轨迹自我纠错。
- 作者称它是首个真正能做 agentic work 的 diffusion LLM,可进行规划、工具调用和多轮自修正。
- 配图里的结果显示,它在多项基准上超过 Ling-2.6-flash:SWE-bench Verified 519.0 vs 303.2,SWE-bench Pro 485.3 vs 283.4,SWE-bench Multilingual 459.5 vs 200.6,τ²-Bench 592.8 vs 334.9。
- 速度方面,帖文给出 1.64× BF16 吞吐,FP8 量化还能再提升 18.6%。
- 技术设计包括原生 128K 上下文、MoE、Block Routing,以及基于 Levenshtein editing 的 KEEP/SUBSTITUTE/DELETE/INSERT 机制;RL 阶段用 L-EBPO 来减少长轨迹里错误传播。
这条帖子还说明模型和代码已开源,但厂商是 Ant Group 的 inclusionAI 团队。
所属事件:蚂蚁开源扩散大模型 LLaDA 2.2,主打智能体与自纠错(10 条相关)→
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11